AI 引文造假率近四成:文献稀薄议题过半引用为虚构
实测 10 款大模型生成的 19 份报告、101 条引用,整体虚构率 38.6%;文献稀薄议题高达 54.2%。
10 款主流大模型在生成带引用的研究报告时,近四成引用链接根本不存在;而在文献相对稀薄的议题上,虚构率超过半数。这项版本固定、方法严谨的实测,揭示了一个被广泛低估的风险:AI 越是不熟悉的领域,越倾向于「自信地编造」格式完美的参考文献。
研究设计:两个议题、19 份报告、101 条引用
研究团队向 15 个语言模型发出两道提示:一是对「远程办公与生产力」这一文献极其丰富的领域撰写研究简报,二是对「大学学术诚信中 AI 写作检测」这一文献相对稀薄的领域撰写政策简报。每份报告至少要求 5 条带完整 URL 的引用,并禁止占位链接。
最终 10 个模型产出 19 份可用报告(其中 Nemotron 仅完成一份),共收集 101 条引用。每条引用先由机器解析,再对所有失败案例人工复核确认——机器的「未找到」只是候选,不是结论。整个测试生成成本仅为 11 美分。
被排除在外的有三种情况:返回数据策略拒绝的模型、未能产出可用报告的模型,以及指向真实但拒绝自动化访问的出版商的引用——「不可验证」不等于「虚构」。
参评的 10 个模型
研究固定了具体版本号而非浮动别名,以避免后续无法复现:
- anthropic/claude-sonnet-5
- openai/gpt-5.4-mini
- google/gemini-3.1-flash-lite
- x-ai/grok-4.5
- amazon/nova-pro-v1
- moonshotai/kimi-k3
- z-ai/glm-4.7
- microsoft/phi-4
- ibm-granite/granite-4.1-8b
- nvidia/nemotron-3-super-120b-a12b(仅完成一份简报)
另有 3 个模型因数据策略拒绝、2 个因未能产出可用报告被排除,标记为「缺席而非清白」。
核心结果:整体 38.6%,薄主题翻倍
- 整体虚构率:39 / 101 = 38.6%(95% 置信区间 29.7%–48.4%)
- 远程办公议题(文献丰富):24.5%
- AI 写作检测政策议题(文献稀薄):54.2%,已超过半数
两组数据的分化是这项研究最关键的发现:模型对引用「格式」的理解远胜于对「内容」的理解。当文献足够密集时,格式与内容重合,引用多数真实;当文献变薄,模型仍会保持「格式」——一个看起来像新闻编辑部的 URL、一段格式完全合规的期刊标识、一所真实大学的页面——并凭空捏造「内容」。
虚构的具体形态
这些虚构并非乱码,而是高度仿真:真实报社域名上一篇从未发表过的新闻、真实大学网站上不存在的指南页、格式完美的期刊标识解析为空。换言之,每一处表面合法性信号都附着于虚无。
另有 1 条引用虽然指向一篇真实且可解析的论文,却将其归属到该论文并未做出的论断——这是更隐蔽的「误归属」失败,单靠 URL 解析无法捕获。研究也提到,在所有能解析到来源的论断中,没有出现被来源反驳的情况——即未解析的引用掩盖了更深的失真。
