桃子桃子快讯
返回首页
研究论文

基于证据链评估的选择性事实核查框架

arXiv 新文提出 ECE 框架,让大模型在证据薄弱时弃权而非强行判定真伪,并公开代码。

2026.07.22 · 周三3 分钟阅读

arXiv 上的一项新研究提出了「证据链评估(Evidence Chain Evaluation, ECE)」框架,目标是缓解大语言模型在事实核查任务中「被迫二选一」所带来的可靠性风险:即便支撑证据薄弱、稀疏或内部不一致,系统也可能自信地输出真或伪的判断。ECE 的核心思路是引入「不确定」这一第三选项,允许系统在证据不足时选择弃权(abstention),从而把置信度与证据强度对齐。

框架设计:工具增强的核查智能体

ECE 的执行单元是一个「会调用工具」的核查智能体(tool-using verification agent),可同时调用三类外部资源来搜集证据:

  • 通用网页搜索(web search)
  • 学术搜索(scholarly search)
  • 可执行检查(executable checks)

在汇总证据之后,智能体返回一个结构化判定结果,附带置信度以及来源层级元数据(source-level metadata),为后续是否弃权的决策提供依据。

在 ECE-Bench 上的表现

研究团队在自建的 ECE-Bench 上进行了评估,核心数字如下:

  • 标准准确率:91.6%
  • 覆盖率(coverage):93.7%
  • 已回答样本上的选择性准确率:97.8%

需要指出的是,ECE 在 Expected Calibration Error、Brier score、AURC 等整体校准指标上,并未跑赢最强的检索基线;但在「选择性预测」的取舍曲线上表现出清晰的差异化优势:系统在已回答的样本上保持极高准确率,同时将 95 个样本中的 6 个推迟给人类或其它流程。

弃权集中在低可信度证据来源

进一步分析这 6 个被弃权的样本可以发现,它们高度集中在低可靠性证据场景下——其中 5/6 的证据来源等级为 L4(最低一档)。这支持了论文的核心观点:弃权机制本质上是一种面向「认知薄弱证据」的安全手段,而非模型能力不足时的随机兜底。换言之,ECE 让系统学会了在「不该回答」的时候闭嘴。

与既有工作的边界

论文承认,ECE 并不是在所有校准维度上都更强,其贡献在于把「选择性预测」作为可靠性问题来显式建模,并给出可复现的基准与代码(已在 GitHub 开源)。对于关注大模型幻觉与自动化核查的从业者来说,这是一条值得跟踪的工程化路径:与其追求更高的总体准确率,不如先把「系统什么时候必须拒答」这件事说清楚。

信源