桃子桃子快讯
返回首页
研究论文

重测「64% 大模型可靠性」基准:现代模型得分超 95%

研究者重建 Bang 等人 2023 年的推理评测集,证实 63.41% 数据来源被反复误传,并在现代模型上复测得 96…

2026.08.26 · 周三5 分钟阅读

法国雷诺首席科学官 Luc Julia 多年在媒体、著述乃至法国参议院经济事务委员会听证中,援引「大语言模型可靠性约为 64%」这一说法。该数字实际来自 Bang 等人 2023 年论文摘要中的 63.41%,被四舍五入后广泛传播。一项新的开源重建工作还原了原始评测,并对 GPT-3.5 之外的系统重新计分,结果显示当代模型在该评测上的准确率超过 95%,与「可靠性越来越低」的说法形成鲜明对比。

原始实验究竟是什么

Bang 等人 (2023) 的推理评测并非「对海量事实做真假判定」。其真实设置如下:

  • 从 22 个系列中手工挑选 634 道推理题,分布演绎、归纳、溯因、数学、时间、空间、常识、因果、多跳与类比共 10 类。
  • 在零样本设置下,对 2022 年 12 月 15 日的 ChatGPT 快照做人工评分。
  • 最终报告的准确率为 63.41%,即 634 题中的正确题比例。

原始数字甚至在不同版本间发生过变动:2023 年 2 月的 v1 摘要写的是 64.33% 与 600 题,最终版改为 63.41% 与 634 题。Luc Julia 的引述长期将单一评测数字泛化为「LLM 的可靠性」,属于范畴错误:单一准确率是「模型 × 固定题集」的属性,而非模型本身的稳定属性。

重建后的复测结果

开源仓库「Julia Bench」提供了完整可复现的评测包:

  • 题库与标准答案收录于 data.csv。
  • 提供 10 个随机化分块文件用于向模型投喂。
  • 附带合并与评分脚本,并在文档中明确给出统一打分规则。
  • 另将题集精简为 200 题的平衡子集以便快速复现。

在完全还原 Bang 等人任务设置的前提下,复测结果如下:

  • GPT-3.5:63.41%(原始论文)
  • GPT-5.6 Sol:96.50%(本次重建)
  • Claude Opus 5:98.50%(本次重建)

这意味着「2026 年的模型会比 GPT-3.5 更差」这一可证伪的预测,在其自身题集上并未成立;相反,过去几年该类推理评测普遍经历了从接近零分到饱和的跃迁。

对公共讨论的三层澄清

仓库文档将流传多年的误读拆为三条独立问题:

  1. 实验描述失实:所谓「向 ChatGPT 投喂数百万条已核实事实让其判断真假」并不存在;该评测是 634 道手工挑选的推理题,并非真假核查任务,且原始论文的出处本身在多次复述中也并不稳定,曾被指向另一篇关于对抗与拼写鲁棒性的论文 (arXiv:2302.12095),甚至归因于一份「找不到」的 OpenAI 报告。
  2. 单一数字被当作模型属性:不指定题集就谈「LLM 的可靠性率」是范畴错误。同一模型在不同难度题集上的得分可从 0% 到 100% 任意变化,单点测量不能作为一项技术的持久属性。
  3. 「今天更差」的说法可被检验:与其争论不如复测。该仓库正是把 Bang 等人的题集与评分规则显式化,让任何模型都能在相同任务上得到可比分数;但它测的只是「63.41% 这项任务的得分」,并不能等同于通用「可靠性」。

可复现性说明与遗留疑点

作者明确指出,原始论文与代码并未给出唯一、完整的可复现公式直接得出 63.41%,因此重建工作在保留原始 prompt、来源顺序与最终 trial 分配的同时,把评分规则显式化。一些尚未完全消解的不一致包括:

  • v1 摘要为 64.33% / 600 题,最终版为 63.41% / 634 题。
  • Mathematics Dataset 一节在正文与附录 F.2 中为 7/30,但表 5 写作 13/30。
  • 正文中一处将 bAbI 任务 15/16 标签互换;附录表 11 与仓库始终按 15 为演绎、16 为归纳处理。
  • 最终 634 trial 的拆分方式为 17 系列 ×30 + 2 个 SpaRTQA 系列 ×32 + 3 个 StepGame 诊断 ×20,合计 17×30 + 2×32 + 3×20 = 634。

该仓库仅重建了 Bang 等人论文摘要中与 63.41% 直接相关的「推理」评测部分,不涵盖摘要、翻译、情感、对话、多模态、虚假信息或幻觉等实验。研究与媒体引用时,仍宜回到原始 ACL Anthology 论文、当前 arXiv 记录、v1 PDF 以及官方抽取仓库进行交叉核对。

信源