TMLR 主编约谈揭 AI 代写论文乱象
机器学习期刊 TMLR 主编约谈 10 篇投稿作者,3 人答不出自己论文的基础问题,反映 AI 代写论文已成行业普遍难题…
机器学习期刊 TMLR(Transactions on Machine Learning Research)联合主编、卡内基梅隆大学的 Nihar B. Shah 在两周轮值期内,挑出 10 篇原本要被直接拒稿的论文,逐一约作者通话,结果 3 位作者连自己论文的基础问题都答不上来。9 月 16 日,Shah 在 TMLR 官方博客发文《向作者询问他们自己的论文》,披露了这次试验的全部经过。同为主编的 Gautam Kamath 在 X 上称之为「英勇的实验」,并表示它证实了许多人心里的猜测:一部分投稿者并不知道自己论文里写了什么。
试验详情:10 篇全被拒,3 篇作者答不上基础题
试验发生在 2026 年 8 月 14 日至 28 日。Shah 从待拒稿中非正式抽取 10 篇,通过 OpenReview 邀请作者在送审前通话。10 篇中:
- 1 篇作者直接撤稿;
- 1 位作者表示没空通话;
- 8 位约上时间,其中 1 位未到场;
- 最终与 Shah 面对面沟通的为 7 篇,涵盖本科生、硕士生、博士生、高校教师和独立研究者。
Shah 的提问分两类:问题设定、符号、论文声称结果等基础问题,以及技术表达式、理论结果和实验设计等细节问题。结果显示:
- 仅 1 位作者答上了全部问题,但论文本身存在重大结论错误,仍被直接拒稿;
- 3 位能讲清高层思路,被追问技术细节时陷入困难;
- 3 位连基础问题都答不上来,且这 3 篇全是单作者论文;
- 其余论文也全部被拒。
会后还出现两个插曲:两位答不出基础问题的作者会后发来书面答复,经 AI 文本检测工具 Pangram 判定均为「100% AI」;另一位作者在介绍分析方法时,无意间完整描述了一套 p-hacking 流程,即反复调整分析方式直到数据「显著」。需要指出的是,Shah 自己也借助 LLM 辅助理解论文,他关注的不是作者是否使用 AI,而是作者能否为署名内容负责。
TMLR 的应对:配额制度、AI 审稿、明确清晰写作标准
TMLR 创刊于 2022 年,由 JMLR 团队运营,以「只看结论是否被证据支撑」著称。过去一年,TMLR 投稿量增长到三倍,单作者投稿暴增 13 倍,编辑部甚至出现过一天投出 5 篇的情况。直接拒稿比例已从 2023 年的约 6% 升至约 53%。
为此,TMLR 今年以来密集推出三项措施:
- 按作者设置年度投稿配额:单作者最多 2 篇/年,9 人合著最多 9 篇/年,活跃审稿人和执行编辑额度翻倍;
- 引入 AI 审稿:每篇投稿附带 CSPaper 生成的可靠性评估,最终决定仍由执行编辑作出;
- 把「写得清楚」写进录用标准,明确要求论文向读者清楚地传达发现。
不只是 TMLR:NeurIPS、arXiv 同样承压
AI 代写论文并非 TMLR 一家的问题。NeurIPS 2026 立场论文赛道 971 篇投稿中,有 273 篇(28.2%)被 Pangram 判为 AI 分数 100%;「评测与数据集」赛道 Pangram 分数不低于 90% 的论文数量较 2025 年增长十倍以上。
5 月中旬,arXiv 计算机科学板块负责人 Thomas G. Dietterich 宣布:若投稿中出现作者未检查大模型输出的确凿证据(如幻觉参考文献、残留聊天机器人对话),所有作者将被禁止在 arXiv 投稿一年,此后投稿须先经正规同行评审渠道接收方可上架。
哥伦比亚大学一项《柳叶瘾》研究还指出,PubMed Central 收录的生物医学论文中,含至少一条虚构引用的比例从 2023 年的约万分之 4 升至 2026 年初的约万分之 57。
从查文本到查人:greCAPTCHA 的思路
Shah 承认本次试验耗费他 20 至 25 小时,只处理 8 篇论文,难以规模化。他与 CMU 团队最近发布了 greCAPTCHA 评估方法,思路是直接考作者本人。
系统根据作者提交论文与个人贡献说明自动生成题目,在监考条件下作答,最终生成评估报告供期刊、招聘或招生方参考。考察的能力被称为「核验能力」,题目分四类:
- 在多版本中识别论文真实报告的数据;
- 解释论文未写明理由的设计选择;
- 解释论文默认读者已知的背景概念;
- 指出方法在什么具体条件下会失效。
31 名研究者的测试显示,系统区分自己论文与陌生论文的 AUC 达 0.90,但最低误判率仍约 20%。一位受试者把陌生论文丢给 AI 讲解后,依然答不上深入问题,陌生论文得分 1.3、自己论文得分 51。
Shah 在试验文章结尾给出两点结论:在学术贡献主要通过署名认定的今天,作者若无法解释和捍卫自己论文,其发表作为「贡献信号」的价值将大打折扣;许多期刊会议邀请投稿者互审,若作者连自己的论文都看不懂,审稿循环一旦断裂,同行评审的根基就会被掏空。
