桃子桃子快讯
返回首页
研究论文

AI 同行评审实测:100 处人为错误,最强单模型仅识别 71 处

作者与 Claude 合作,在 10 篇心理学论文中植入 100 处已知错误,测试多款 AI 评审工具的识别能力,发现多…

2026.08.11 · 周二3 分钟阅读

一名研究者与 Claude 合作,在 10 篇开放获取的心理学论文中人为植入了 100 处已知错误,随后将论文交给多款前沿大模型以及两款商业化 AI 评审工具进行检验。实验结果显示,即便表现最好的单一系统也只能识别 71 处错误,而表现最差的仅能识别 30 处;将所有系统的输出合并后,总计可识别 93 处错误。这一结果提示,当前 AI 同行评审工具仍有明显盲区,但通过模型集成可以显著缩小漏检范围。

实验设计:构建 100 处错误与 62 类错误分类

作者参照 INSPECT-SR 等既有清单,构建了一份涵盖 62 个类别的实验心理学论文错误分类体系,涵盖统计错误、构念效度、因果推断、可推广性等维度。随后在每篇论文中植入 10 处错误,共 100 处。

第一版植入的错误过于浅显,论文一旦跑过大模型即被全部识别,基准迅速饱和。为此,作者在后续版本中做了两项关键调整:

  • 不只插入错误表述,还删除论文中关键条款或说明性语句,使错误变得「隐晦」。例如在某篇论文中删除了元分析所需的统计变换步骤;在另一篇论文中删除了关键因变量的计算说明,使外部审阅者难以判断研究结论的有效性。
  • 错误类型尽量覆盖「遗漏型」与「插入型」两类,以更贴近真实审稿情境。

测试对象与评估方法

被测系统包括:

  • 三个前沿基础模型的不同版本:Claude、ChatGPT、Gemini。
  • 两款商业化 AI 论文评审服务:Reviewer3 与 Refine.ink。

对基础模型,研究者将同一篇论文重复运行三次,以检验其测试–再测试可靠性,并考察多次采样能否发现更多错误(初步结果显示并不能)。最终使用 LLM-as-judge 对每个系统指出的问题进行复核,判断是否对应某一处植入错误。

关键发现

  • 最佳单模型仅识别 71 处,最差 30 处。
  • 合并所有系统输出可识别 93 处。不同模型在识别错误上仅存在部分相关性,集成是放大覆盖率的关键杠杆。作者建议将论文交给多个模型交叉审阅。
  • 仍有 7 处错误无系统能识别,且全部属于「信息被删除」类型的遗漏,而非显式插入的错误。
  • Refine.ink 贡献了最多的独立识别,但成本较高。

局限与后续工作

作者明确指出本实验存在以下局限:

  • 未测量假阳性率,即系统在不存在错误的地方「挑刺」的情况。
  • 100 处错误的分布未必能代表真实论文中的真实错误分布。
  • 仅覆盖心理学领域,结论能否推广到其他学科尚待验证。

作者已公开论文、植入的错误、各模型输出以及完整实验日志,希望研究者以此为基础,搭建跨学科、更全面的 AI 同行评审基准。

背景:AI 同行评审为何变得紧迫

文章指出,AI 辅助下科研产出正在快速增加,但人类整体的注意力带宽并没有同步扩张。科学知识的体量与深度正在逼近任何单个人类心智可以承载的极限。一个随之而来的问题是:当科学越来越依赖 AI 生成,也越来越依赖 AI 来评判,学者如何判断这些评审结果是否可靠?作者认为,AI 同行评审的能力正在「变得相当不错」,但究竟好到什么程度、什么时候可以把缰绳交给它,仍缺乏可量化的评估手段,这也是本实验的出发点。

信源