研究论文
CoCo:面向 MoE 奖励模型的响应级可解释性新方法
研究者提出 CoCo 贡献对比方法,用 chosen-rejected 响应对的贡献差异刻画专家行为,被称作首个系统研究…
2026.08.10 · 周一约 2 分钟阅读
核心问题
奖励模型是「基于人类反馈强化学习(RLHF)」对齐流程中的关键组件,但学界对其预测背后驱动因素的理解长期不足。近期出现的稀疏化「混合专家(MoE)」奖励模型试图通过路由权重把不同提示分发给不同专家,并以路由权重高的样本概括专家角色。然而路由权重只能反映「哪些提示会被送到某个专家」,并不能揭示该专家「如何评判响应」,因此对专家行为的刻画是片面的。
方法:Contribution-Contrast(CoCo)
为弥补这一缺口,作者提出 Contribution-Contrast(CoCo)响应级解释方法。该方法选取在「被选响应 vs 被拒响应」配对中贡献差异最大的样本对,作为刻画专家角色的代表样本,从而把路由行为与偏好判断行为联合纳入解释框架。换言之,CoCo 不再只看提示端的路由分布,而是直接在响应层级度量每个专家对成对偏好的贡献差异。
评估与对比基线
论文将 CoCo 与三类已有方法进行对比:
- 基于路由权重的方法(router-based);
- 基于评分的方法(score-based);
- 基于稀疏自编码器的方法(sparse autoencoder-based)。
在自动评估与人类评估中,CoCo 生成的解释均比上述基线更连贯、更忠实、更具专家专长化特征,同时保持与现有方法相当的奖励建模准确率。作者强调,这是首个针对 MoE 奖励模型解释方法的系统研究。
意义与局限
MoE 架构正被越来越多的大语言模型采用,理解其内部专家分工对模型审计、安全分析与对齐研究均有价值。CoCo 提供了一条响应级的解释路径,使研究者能在偏好信号层面追溯某个专家的具体贡献。不过,目前公开材料仅为 arXiv 摘要,具体实验设置、所用奖励模型规模与基准数据集尚未披露,其通用性与可复现性仍需等待正文与代码释放后进一步验证。
