研究论文
arXiv 新方法 CASE:用隐藏态挑选替代多数投票,最高提升 19 个百分点
论文提出 CASE 方法与 decodability 指标,可在投票前预测隐藏态挑选是否更优,对中等与高难度问题分别最高…
2026.08.19 · 周三约 2 分钟阅读
arXiv 最新论文提出一种名为 CASE(Correctness-Axis SElection)的动态选择方案,用于改进大语言模型在测试时对多次采样答案的融合策略。研究指出,传统多数投票在难题上会因为采样答案共享相关错误而失效——采得越多,错误答案越容易胜出。
研究动机:从投票走向隐藏态挑选
在大模型中,针对同一问题采样多条回答再合并,是常见的测试时信息融合做法。然而当问题较难、回答分布高度相关时,多数投票会出现「错答胜出」的退化现象,更密集的采样反而拉低正确率。另一类思路是从模型隐藏态中读取正确性信号来挑选候选,但这种方式在不同模型与任务上表现不稳定,且缺乏事先判断其是否值得使用的准则。
CASE 方法与 decodability 准则
论文的核心贡献包含两部分:
- CASE 合并器:在答案 token 的隐藏态上训练一个线性门控,对每个候选打分后挑选得分最高者。
- decodability 指标:一种「无泄漏」度量,刻画门控把正确答案排序在错误答案之上的能力,可在合并前预先估计哪种策略更优。
研究同时指出,常规探针看似有效,很大程度上源自「问题身份泄漏」——在按问题分组的评估设置下,这种泄漏消失,探针表现随之大幅回落。
关键实验数据
- decodability 对「挑选相对于投票的准确率增益」的预测能力,与真实增益的 Pearson 相关系数 r=0.75,决策阈值在 AUC≈0.60 附近。
- 在通用与医学领域大模型上,CASE 在中等难度问题上较投票最高提升 19 个百分点,在高难度问题上最高提升 16.8 个百分点。
- decodability 取决于模型需要回想的对齐知识,而非模型规模本身。
- 该指标在一个未见过的科学领域上迁移时,预测偏差约为 3.8 个百分点。
意义与局限
这项工作把「隐藏态挑选 vs. 多数投票」从凭经验选择,转变为可在给定模型与任务上预先度量的决策问题,为测试时计算策略的自动化选择提供了实用准则。论文目前以 arXiv 预印本形式公开(编号 2608.17124v1),尚未公布同行评审或代码仓库信息,方法在更大规模模型与更多任务族上的稳定性仍有待后续工作验证。
