研究论文
LLM 自动化系统文献综述:GPT 在 536 篇流行病建模论文上的实证
研究用 GPT-4.1 与 GPT-5 批量提取 536 篇智能体建模论文信息,文章级准确率约 78%–82%,并发现模…
2026.08.28 · 周五约 2 分钟阅读
近期一项发表于 arXiv 的研究尝试用大语言模型(LLM)自动完成系统文献综述(Systematic Literature Review, SLR),聚焦于疾病传播领域的智能体建模(agent-based modeling)论文。研究团队搭建了一条 LLM 抽取流水线,从 536 篇同行评审论文中提取模型相关字段,并与人工完成的 SLR 结果进行对照。
研究方法
研究的核心问题是:LLM 能否替代或辅助研究者完成高强度的文献筛选与信息抽取?团队针对同一批论文分别用 GPT-4.1 与 GPT-5 进行处理,并比对其输出与人工标注之间的差异。评估粒度分为两层:
- 论文级(paper-level):整篇文章是否被正确归类或匹配;
- 字段级(field-level):单条信息(如模型类型、参数设定、研究结论等)是否被正确抽取。
关键结果
研究给出了较为具体的量化结果:
- 论文级准确率:GPT-4.1 约为 77.95%,GPT-5 约为 81.67%;
- 字段级准确率:范围跨度极大,从 32.40% 到 100.00% 不等,复杂或主观性较强的字段表现明显更差。
这意味着整体任务可用 LLM 辅助,但具体到细粒度信息,仍需人工把关。
一致性可作为质量信号
论文的一个较有价值的发现是:LLM 之间的一致性可被用作输出质量的间接指标。具体而言:
- 当多个 LLM 输出不一致时,可能预示着幻觉(hallucination)风险;
- 当多个 LLM 输出高度一致但准确率却低时,往往指向人工数据集本身存在噪声或标注错误。
这一观察为「机器辅助 + 人工校验」的工作流提供了一个可操作的判据。
局限与启示
作者也坦承研究的边界:536 篇论文集中在智能体建模与疾病传播领域,结果未必能直接推广到其他学科;字段级准确率的剧烈波动说明,简单替换人工并不现实。文章最后强调,LLM 在 SLR 中的角色更可能是「放大器」而非「替代者」,结合 prompt 迭代与一致性校验才能发挥实际价值。
