桃子桃子快讯
返回首页
研究论文

arXiv 研究:长上下文大模型生成文献综述仍需人工把关

研究比较不同上下文窗口下 LLM 生成文献综述的质量,发现长上下文能覆盖更多内容但易出现重复和遗漏,仍需领域专家审校。

2026.08.28 · 周五2 分钟阅读

一篇发表于 arXiv 的研究论文对大语言模型(LLM)生成的学术文献综述进行了系统评估,重点比较了短上下文与长上下文设置下输出质量的差异。研究指出,AI 生成的综述可作为基础性参考,但距学术发表标准仍有差距,必须由领域专家进行审校与精修。

研究方法

研究者从 Semantic Scholar 与 arXiv 抓取研究资料,基于这些来源让 LLM 生成了二十篇文献综述,并由两名研究人员从 15 个维度进行评估。该方法覆盖了内容覆盖度、逻辑连贯性、批判深度等关键指标,旨在系统比较不同上下文长度对输出质量的影响。

核心发现

研究的主要结论可归纳为以下几点:

  • 随上下文窗口增大,LLM 能够纳入更广泛的信息,并在更长输入中保持连贯性。
  • 长上下文设置下,内容重复、关键文献遗漏以及「描述多于综合」等问题被进一步放大。
  • AI 生成的综述能够提供基础性概览,但在分析深度与原创性综合方面不足以替代人工。

局限与未来方向

作者指出,AI 生成的综述「需要人类监督以达到学术出版标准」。论文建议未来工作可考虑:

  • 引入更多样化的 LLM 与领域微调模型进行对比。
  • 采用结合人类专业知识与 AI 能力的混合工作流,以缓解当前研究中发现的能力局限。

总体而言,这篇论文为学术界如何在大模型辅助下进行文献综述提供了较为审慎的实证依据,强调了人机协作而非全自动生成的必要性。

信源