桃子桃子快讯
返回首页
研究论文

AI审计顶刊论文:99.2%存在客观错误

ICML 2026论文经AI Agent审计复现率仅四成;GPT-5驱动的检查系统发现99.2%顶刊论文至少含一处客观错…

2026.08.10 · 周一4 分钟阅读

近期,多个研究团队利用 AI Agent 对顶级 AI 会议论文展开系统性复现与错误检测,结果显示学术界长期存在的可验证性危机正被大规模暴露。

顶会论文复现率不容乐观

同行评审受精力所限,审稿人几乎无暇从头下载数据、运行模型以验证论文中的每一处实验结论;而 AI 领域论文数量持续爆炸,模型与实验日益复杂,一篇论文涉及的代码、数据、参数细节可达数百处,论文可复现性变得愈发关键。

7 月 22 日,美国一家研究审查公司使用 AI Agent 对 ICML 2026 全部 168 篇口头报告论文进行了系统性结果复现审计。其中 92 篇拥有至少 5 条可供验证的结论性声明,最终能够成功复现超过四成结论的论文只有 34 篇,而能复现八成以上结论的仅有 8 篇。

复现失败并不意味着研究造假,原因包括但不限于:

  • 代码缺少关键文件、依赖库版本断裂、运行结果与论文不符;
  • 部分论文依赖的模型已下线,实验结果永久性无法复现,本次涉及 4 篇;
  • 存在明显数据失实,例如一篇论文将「仅训练基础模型 0.77% 的参数」作为卖点,但实际开源 checkpoint 训练了 6.31% 的参数,相差约 8 倍;
  • 还有论文展示了一张基于某评判模型的可靠性表格,但开源代码中根本不含该评判模型,也无任何脚本可生成表格结果。

与此同时,Hugging Face 与 AlphaXiv 联合发起了针对 ICML 2026 的「Agent Reproduction Challenge」挑战赛,邀请研究者使用 AI Coding Agent 对接收论文进行自动化复现,结果同样不乐观。

99.2% 的顶刊论文至少存在一处客观错误

2025 年底,一项研究开发了基于 GPT-5 的论文检查系统,用于分析已发表在顶级 AI 会议与期刊上的论文,专门寻找可客观验证的错误。研究者明确表示:只关注「客观错误」,不评判论文的创新性与研究价值。

最终结果显示:

  • 平均每篇论文被检测出 4.7 个客观错误;
  • 99.2% 的论文至少被标记出一处问题;
  • 数学与公式错误占比最高,达 54.0%(含方程式写错、推导逻辑漏洞、证明中的错误假设等);
  • 约 30.8% 的 NeurIPS 论文和 23.8% 的 ICLR 论文包含至少一个可能影响结果解读的实质性错误;
  • 时间趋势上,NeurIPS 论文的篇均错误数从 2021 年的 3.8 个上升至 2025 年的 5.9 个,涨幅 55.3%。

AI 重审百年科学文献成为可能

论文错误并非 AI 时代独有。浙江实验室理论化学家 Pios 在使用 AI 预测分子沸点时,发现结果与一份 75 年前的化学数据库存在明显冲突。手动回溯原始文献后,他发现 AI 竟是对的;进一步核查还发现,一份约一个世纪前、被学界公认权威的沸点测量值同样是错的。

现代科学论文数量已远超任何个体研究者的阅读极限。仅 ICLR 一家顶会的年度投稿量就从 2018 年的 1013 篇飙升至 2026 年的 19619 篇。在这一规模下,一处最初出现在某篇论文中的错误一旦被后续文献反复引用,就会沿引用链持续传递,形成事实上的「学术共识」。

如今,借助 AI,人们首次具备了大规模重审过往科学文献的技术能力。不过以 GPT-5 驱动的 Paper Correctness Checker 为例,其检测精确率约 83.2%,每次检测仍有约四成真实错误未被检出。这意味着 AI 核查工具仍不足以担任科学文献的判官,其输出结果最终仍需人工审核。

或许未来,论文发表不再意味着研究宣告「胜利」,而只是再次进入下一轮 AI 验证的开始。

信源