桃子桃子快讯
返回首页
研究论文

前沿大模型事实判定分歧研究:63% 声明存异议

Lenz Research 测试五个前沿大模型判定 997 条事实声明,发现 63% 未能达成共识,模型置信度亦不可靠。

2026.08.12 · 周三2 分钟阅读

由 Lenz Research 联合博科尼大学(Bocconi University)与索菲亚美国学院(American College of Sofia)开展的一项研究,对五个前沿大模型在事实判定任务上的一致性进行了系统性测试。研究者向每个模型提交来自事实核查平台的 1,000 条真实用户声明,要求其在五档量表上给出 True 到 False 的判定,并报告 1–10 的置信度。结果显示,在 997 条所有模型均给出可用判定的声明中,分歧程度远超此前基于公开基准的「准确率相当即可互换」的假设。

主要发现

研究披露了一组具体数字,量化了模型间的分歧结构:

  • 63% 的声明(632 / 997,95% CI 60–66%)上,至少有一个模型与多数意见相左,或根本无法形成多数。
  • 23% 的声明(232 / 997,95% CI 21–26%)上,最远两个模型的判定相差至少两档,构成「实质争议」而非标定差异。
  • 997 条声明上、五个模型的序数 Krippendorff's α = 0.77,表明判断结构化但远非可互换。
  • 分歧集中在中间档判定:极端正反两极约一半达成一致,而中间档仅约一成达成一致。
  • 模型在 76% 的答案上自评置信度为 9 或 10,但彼此对置信度的 Krippendorff's α 仅 0.44,远低于判定一致性。

方法与数据

研究者明确说明,测试所用声明均不来自任何公开基准,以避免「模型在训练数据中见过、因而表现虚高」的污染。模型以五档量表(从 True 到 False)输出判定,并附带 1–10 的置信度自评。统计上同时给出 95% 置信区间与序数 Krippendorff's α,以同时反映一致性的结构性与离散程度。

意义与局限

论文指出,越来越多用户使用大模型核查信息,而本研究表明「使用哪个模型」会显著影响最终判定,且模型自报的置信度并不能预测其他模型是否认同。这意味着将单一模型作为事实裁决者存在系统性风险,需引入多模型投票、对中间档声明设置高阈值等工程化对策。

研究附带 PDF 报告、CSV 原始结果与 GitHub 上的评测代码与语料(lenzhq/lenz-research),便于独立复现与扩展测试。

信源