桃子桃子快讯
←返回首页
行业动态

NeurIPS 2026 立场论文结果出炉,Pangram 检测争议被作者自行修正

Reddit 用户对三周前关于 NeurIPS 立场论文与 Pangram 检测的帖子进行事实核查,纠正多处表述,并保留…

2026.09.26 · 周六约 3 分钟阅读

一位 Reddit 用户在三周前发布的关于 NeurIPS 2026 立场论文(Position Track)与 AI 检测工具 Pangram 的帖子,近日被作者自己用一手资料做了事实核查,并部分推翻原始说法。NeurIPS 立场论文的录用决定已于 24 日公布,但这场围绕「AI 检测是否被滥用」的争论并未因此平息。

被纠正的原始说法

作者回到 NeurIPS 官方博客与原始数据表,逐条修正了此前帖文中的几个关键表述:

  • 涉及 79 篇论文的拒稿层级,其标准并非「0.8 阈值 + 唯一作者」,而是 0.8 阈值叠加「多篇独立投稿的同一作者」或「该作者另有一篇桌面拒稿(desk reject)」。原始分类依据见 NeurIPS 官方博客 Table 5。
  • 涉及 22 篇论文的另一层级,其判定对象并不限于「明确否认使用 AI」的作者,也包括「AI 使用声明留空」的作者。
  • 原帖中所称的「独立研究者」实际上只有一人——Sergey Berezin,且他本人明确表示,并未对大会主席们论文的写作方式做出过任何评判。
  • 关于「61% ESL 误判率」的说法出自 2023 年一项针对另外七款检测器的研究,并不直接等同于 Pangram 的表现。

仍然成立的部分

尽管分类细节有误,作者指出 Pangram 在「人类撰写、AI 润色」这一最难场景下的真实表现仍然堪忧:

  • Pangram 自家 v4 报告(arXiv 2607.27183, Table 28)测试的正是 NeurIPS 实际使用的 v3.3.2 版本。结果显示,在人类撰写但经 AI 润色的同行评审文本上,v3.3.2 将 14.9%(简单子集)与 4.5%(困难子集)的内容判为「完全由 AI 生成」,准确率反而低于 v3.0 与 v4。
  • NeurIPS 立场论文政策明确允许「润色」类 AI 使用,因此上述误判几乎不可避免。
  • 一篇 ICML 2026 论文(arXiv 2603.20450)专门以这些拒稿案例为对象,指出按窗口计算的误报率不应被外推至整篇论文,无论正向还是反向。

仍未公开的关键数字

NeurIPS 共发出 123 篇「有条件接收」(conditional accept)的论文,要求作者修改后重新提交。截至目前,主办方尚未公开其中有多少篇最终通过复核、又有多少篇因触发 Pangram 警报而被拒。这一悬而未决的数据,是判断本次检测政策实际杀伤力的核心依据。

完整事实核查与图表见作者博客 strictcite.com,原帖亦附有 NeurIPS 博客、arXiv 论文与 LinkedIn 评论的原始链接。

信源