桃子桃子快讯
返回首页
行业动态

LLM 写出的参考文献,越来越多根本不存在

ICLR 2026 因参考文献造假批量拒稿,暴露大模型在学术写作中的引用幻觉顽疾,检索增强方案仍难根除。

2026.08.16 · 周日4 分钟阅读

机器学习领域顶级会议 ICLR 2026 的程序主席们在审稿阶段发现,多篇投稿的参考文献指向并不存在的出版物。这些「幽灵文献」并非思想实验,而是真实出现在投稿论文末尾的引用条目。大会为此搭建了筛选系统,将可疑条目交由领域主席复核,再由程序主席二次确认;每一条确认造假的引用都导致稿件被直接拒稿(desk reject)。最值得关注的不是结果,而是流程:要确认一条参考文献「不存在」本身就需要多轮人工核查,自动化检测器频繁误报,译名差异也制造了噪音,会议最终没有把判定权交给任何单一检测工具。

引用幻觉并非新鲜事

大模型「编造文献」的能力早已被记录在案。2023 年,William H. Walters 与 Esther Isabelle Wilder 让 GPT-3.5 和 GPT-4 在 42 个主题上各写一段简短文献综述,并核查了 636 条生成引用。结果显示,GPT-3.5 生成引用中有 55% 无法验证为真实存在,GPT-4 也达到了 18%;即便指向真实文献,也常有作者、期刊、年份等关键信息的严重错误。

这一数字本身并不能直接推断当前学术界有多少比例的引用由模型代笔——一条错误的参考文献并不会标注「本条由 AI 生成」,而且在 ChatGPT 出现之前,人类就一直在制造错引和抄袭。但 ICLR 2026 的案例确认了一个关键事实:这些伪造引用通过了作者准备投稿的全部流程,进入了主流学术会议的审稿池。文献综述的「形」在那里,「实」却并不存在。

检索增强:让引用可以被反驳

最直接的应对方式是把模型接上搜索系统。OpenScholar 从约 4500 万篇开放获取论文的语料中检索段落,生成带引用的回答,再通过反复检索与引用校验进行修正。其论文报告称,这一系统相比通用模型在科学综述任务上的引用准确率与回答正确率都有显著提升。

值得追问的是它「为什么更好」。答案并不是模型学会了更自信地解释自己的来源,而是任务本身被改写了:候选论断必须挂接到检索回来的具体段落,引用条目可以与生成文本之外的真实文档比对,专家读者也能检查来源是否真的支持原句。检索并不能让文献综述变「真」——真实论文仍可能被误读、断章取义或被要求承担其实验支撑不了的论断——它提供的是「被反驳的可能性」:段落之外终于有东西可以指出段落的错误。

流畅的「支持」与可证伪的「证据」之间

这种区分在更广泛的科研活动中同样存在。模型如今可以帮助提出问题、检索相关工作、编写实验代码、选择统计检验、生成图表、解释图表、起草局限性,乃至审阅终稿;每一次输出都可以成为下一步的输入,单人即可走完过去需要更长时间或更多协作才能完成的全流程。

文章作者以自己开发 SetScope——一个能在 Goose 乐队直播中实时识别并发布当前歌曲的工具——为例,描述了「人在回路外」的 AI 辅助研究体验:把标注录音和任务目标交给系统,让其自行生成歌曲识别方案、训练模型、运行测试、检查错误并决定下一步尝试方向。实现速度是这一计划对单人可行的关键,但也让「流畅的支持」与「可证伪的证据」之间的鸿沟更难察觉:当一份研究报告在结构、措辞、引用格式上都无懈可击时,审稿人和读者面对的不再是潦草与精心的区别,而是「看起来像证据」与「经得起检验的证据」之间的差别。

ICLR 2026 的批量拒稿至少表明,顶级会议的程序委员会愿意为这种差别付出成本;至于更广泛的期刊、会议与产业研究流程是否愿意同样投入,仍是悬而未决的问题。

信源