研究论文
LitReview Arena:3000份专家评判揭示自动文献综述仍远逊于人类
研究团队构建对战胜式评测平台,收集约3000份专家评判,发现最强系统仅在23%的对决中胜出人类,并提出更对齐的LitJu…
2026.08.25 · 周二约 2 分钟阅读
针对自动化文献综述难以用传统重叠指标评估的难题,研究团队推出对战胜式评测平台 LitReview Arena,配套一套针对文献综述质量的结构化评测协议。平台通过召集具备 AI 论文写作经验的领域专家,对匿名草稿进行匿名对比,并按专家专长匹配论文主题,确保评审的领域适配性。
评测机制与数据规模
LitReview Arena 采用五维文献综述专属评分体系,覆盖论文结构、研究建议等「重综合」维度。平台共收集约 3000 份专家评判,每份评判均包含五个维度的独立评分。基于这套偏好数据,团队还训练了经专家校准的评估器 LitJudge,代码与数据已开源在 GitHub。
关键发现
- 当前最强的自动文献综述系统在「整体效用」维度上,仅在 23.0% 的决定性对决中胜出人类草稿。
- 智能体式大模型(如 Sonar Deep Research)相较基础语言模型优势超过 60%,表明 agent 化工作流显著提升综述质量。
- 现有 LLM-as-a-judge 方法与人类专家的对齐度仅为 Spearman 相关系数 0.467,在结构与建议类综合维度上偏离尤为明显。
- 团队提出的 LitJudge 将对齐度提升至 0.78,已接近人类专家间一致性水平。
对方法论的意义
研究结果对自动化综述与 LLM 评测两条主线均具参考价值:一方面证实 agent 框架对长文综合任务的关键作用,另一方面提示业界依赖 LLM 充当裁判的做法存在系统性偏差,需引入专家校准或人机混合评估作为补充手段。该平台也为后续文献综述智能体的迭代提供了可复现的人类偏好基准。
