桃子桃子快讯
返回首页
研究论文

LLM 自动化系统文献综述:GPT 在 536 篇流行病建模论文上的实证

研究用 GPT-4.1 与 GPT-5 批量提取 536 篇智能体建模论文信息,文章级准确率约 78%–82%,并发现模…

2026.08.28 · 周五2 分钟阅读

近期一项发表于 arXiv 的研究尝试用大语言模型(LLM)自动完成系统文献综述(Systematic Literature Review, SLR),聚焦于疾病传播领域的智能体建模(agent-based modeling)论文。研究团队搭建了一条 LLM 抽取流水线,从 536 篇同行评审论文中提取模型相关字段,并与人工完成的 SLR 结果进行对照。

研究方法

研究的核心问题是:LLM 能否替代或辅助研究者完成高强度的文献筛选与信息抽取?团队针对同一批论文分别用 GPT-4.1 与 GPT-5 进行处理,并比对其输出与人工标注之间的差异。评估粒度分为两层:

  • 论文级(paper-level):整篇文章是否被正确归类或匹配;
  • 字段级(field-level):单条信息(如模型类型、参数设定、研究结论等)是否被正确抽取。

关键结果

研究给出了较为具体的量化结果:

  • 论文级准确率:GPT-4.1 约为 77.95%,GPT-5 约为 81.67%;
  • 字段级准确率:范围跨度极大,从 32.40% 到 100.00% 不等,复杂或主观性较强的字段表现明显更差。

这意味着整体任务可用 LLM 辅助,但具体到细粒度信息,仍需人工把关。

一致性可作为质量信号

论文的一个较有价值的发现是:LLM 之间的一致性可被用作输出质量的间接指标。具体而言:

  • 当多个 LLM 输出不一致时,可能预示着幻觉(hallucination)风险;
  • 当多个 LLM 输出高度一致但准确率却低时,往往指向人工数据集本身存在噪声或标注错误。

这一观察为「机器辅助 + 人工校验」的工作流提供了一个可操作的判据。

局限与启示

作者也坦承研究的边界:536 篇论文集中在智能体建模与疾病传播领域,结果未必能直接推广到其他学科;字段级准确率的剧烈波动说明,简单替换人工并不现实。文章最后强调,LLM 在 SLR 中的角色更可能是「放大器」而非「替代者」,结合 prompt 迭代与一致性校验才能发挥实际价值。

信源