桃子桃子快讯
返回首页
研究论文

AI 引文造假率近四成:文献稀薄议题过半引用为虚构

实测 10 款大模型生成的 19 份报告、101 条引用,整体虚构率 38.6%;文献稀薄议题高达 54.2%。

2026.08.29 · 周六3 分钟阅读

10 款主流大模型在生成带引用的研究报告时,近四成引用链接根本不存在;而在文献相对稀薄的议题上,虚构率超过半数。这项版本固定、方法严谨的实测,揭示了一个被广泛低估的风险:AI 越是不熟悉的领域,越倾向于「自信地编造」格式完美的参考文献。

研究设计:两个议题、19 份报告、101 条引用

研究团队向 15 个语言模型发出两道提示:一是对「远程办公与生产力」这一文献极其丰富的领域撰写研究简报,二是对「大学学术诚信中 AI 写作检测」这一文献相对稀薄的领域撰写政策简报。每份报告至少要求 5 条带完整 URL 的引用,并禁止占位链接。

最终 10 个模型产出 19 份可用报告(其中 Nemotron 仅完成一份),共收集 101 条引用。每条引用先由机器解析,再对所有失败案例人工复核确认——机器的「未找到」只是候选,不是结论。整个测试生成成本仅为 11 美分。

被排除在外的有三种情况:返回数据策略拒绝的模型、未能产出可用报告的模型,以及指向真实但拒绝自动化访问的出版商的引用——「不可验证」不等于「虚构」。

参评的 10 个模型

研究固定了具体版本号而非浮动别名,以避免后续无法复现:

  • anthropic/claude-sonnet-5
  • openai/gpt-5.4-mini
  • google/gemini-3.1-flash-lite
  • x-ai/grok-4.5
  • amazon/nova-pro-v1
  • moonshotai/kimi-k3
  • z-ai/glm-4.7
  • microsoft/phi-4
  • ibm-granite/granite-4.1-8b
  • nvidia/nemotron-3-super-120b-a12b(仅完成一份简报)

另有 3 个模型因数据策略拒绝、2 个因未能产出可用报告被排除,标记为「缺席而非清白」。

核心结果:整体 38.6%,薄主题翻倍

  • 整体虚构率:39 / 101 = 38.6%(95% 置信区间 29.7%–48.4%)
  • 远程办公议题(文献丰富):24.5%
  • AI 写作检测政策议题(文献稀薄):54.2%,已超过半数

两组数据的分化是这项研究最关键的发现:模型对引用「格式」的理解远胜于对「内容」的理解。当文献足够密集时,格式与内容重合,引用多数真实;当文献变薄,模型仍会保持「格式」——一个看起来像新闻编辑部的 URL、一段格式完全合规的期刊标识、一所真实大学的页面——并凭空捏造「内容」。

虚构的具体形态

这些虚构并非乱码,而是高度仿真:真实报社域名上一篇从未发表过的新闻、真实大学网站上不存在的指南页、格式完美的期刊标识解析为空。换言之,每一处表面合法性信号都附着于虚无。

另有 1 条引用虽然指向一篇真实且可解析的论文,却将其归属到该论文并未做出的论断——这是更隐蔽的「误归属」失败,单靠 URL 解析无法捕获。研究也提到,在所有能解析到来源的论断中,没有出现被来源反驳的情况——即未解析的引用掩盖了更深的失真。

信源