桃子桃子快讯
返回首页
研究论文

arXiv 论文:现有 LLM 榜单受评测配置影响巨大,同一模型分数可相差近 60 个百分点

研究人员在 4 个基准、3679 道题上对 12 个开源模型跑了 26 种评测配置,发现 Gemma4-31B 分数可在…

2026.08.25 · 周二3 分钟阅读

一项发表于 arXiv 的研究对当前大语言模型榜单的评测方式提出了尖锐质疑。论文指出,多项选择题基准虽然固定了题目与正确答案,但评测的「harness」(即选项顺序、提示词措辞、答案是从生成文本中读取还是从逐选项的似然中读取)在不同配置下会显著改变结果。在 26 种「同样合理」的 harness 配置下,开源模型 Gemma4-31B 的得分区间在 31% 到 89% 之间,也就是说,仅凭评测设置的不同,同一个模型的分数差距接近 60 个百分点。

研究方法:构建「脆弱度网格」

研究团队将 LLM 评测的 harness 视为独立变量,并把其影响分解到单道题目层面,提出了「fragility grid」(脆弱度网格)的实验设计:

  • 模型:来自 4 个模型家族的 12 个开源权重、可指令微调的 LLM
  • 题目:从 ARC、HellaSwag、MMLU、TruthfulQA 四个基准中抽取共 3679 道题
  • 配置:26 种同等合理的 harness 设置
  • 解码:统一使用 greedy decoding;模型权重固定,题目固定,仅改变 harness

每个「模型 × 题 × 配置」组合对应一个正确/错误比特,研究最后对外公开逐题数据与分析脚本,全部计算可在普通 CPU 上数秒内复现。

三个关键发现

发现一:脆弱题决定模型排序

在两个相邻模型都「稳定答对」的题目上,二者打成平手;而它们之间真正的分数差距,几乎全部落在少数「harness 一变结论就反转」的题上。统计上,这种「配置脆弱题」平均承载了一个模型对之间 95.7% 的差距。也就是说,模型排名基本由最不稳定的那批题目决定。

发现二:harness 可决定第一名

12 个模型中,有 4 个在某种 harness 下能登顶。这意味着,只要选择不同的评测配置,就能「选」出榜单的赢家。论文特别指出,真正起作用的是「如何计分」,而不是评测协议通常会固定的「选项顺序」。

发现三:题目区分度与脆弱度正相关

论文还讨论了基准压缩(benchmark compression)中常用的题目「区分度」指标。结果显示,区分度与脆弱度之间的相关性为 0.28(95% CI 0.25–0.30)。换言之,去掉区分度低的题目,并不能清除脆弱题,反而把它们留了下来。

对榜单生产者的建议

论文把 fragility grid 定位为「一个榜单在公布排序前可以跑的体检工具」,并建议公开榜单在报告排名时,至少同时报告评分对 harness 的敏感区间,而非只给一个被特定 harness 选出来的点估计。研究同时释放了逐题记录与分析脚本,使任何评测者都能在数秒内复现实验并对照检查自己关心的模型与基准。

研究尚未经过同行评议,但其方法、数据与可复现性均较为完整,对当前广泛依赖的多项选择基准排名方法具有直接参考价值。

信源