桃子桃子快讯
返回首页
工具

Integrity Bench:大模型自信度校准的专用基准

新基准通过 Brier 分数衡量主流大模型的置信度误差,结果显示前沿模型普遍存在显著过度自信。

2026.08.28 · 周五4 分钟阅读

一支研究团队发布了一项名为 Integrity Bench 的评测基准,专注于衡量大语言模型在回答问题时的置信度校准(即「对自己答案有多确定」的准确程度)。结果显示,主流前沿大模型普遍表现出明显的过度自信,部分模型的「Integrity Score」甚至跌至深度负值,表明其在难度适中的问题上既会出错,又对自己的错误答案给出高置信度。

基准的核心思路

Integrity Bench 关注的核心指标是模型的置信度校准能力,而不是单纯的答题准确率。研究团队认为:一个模型即使能力很强,如果在自身能力边界附近无法正确评估置信度,就会在实际部署中带来更大风险。

评测流程上,模型被要求在回答一道题目的同时,给出 0%–100% 的置信度(表示「我对这个答案正确的把握有多大」)。团队随后将该置信度与最终对错结果进行比对,得出校准误差。

评估方法

评测采用气象学家 Glenn Brier 于 1950 年提出的 Brier Score 作为底层度量:对每道题,计算 (置信度 − 结果)²,其中结果正确为 1、错误为 0;再对所有题目取平均。

为便于阅读,Brier Score 被进一步换算为 Integrity Score:

  • 公式:Integrity Score = 100 − 400 × Brier
  • 100 分代表完美校准
  • 0 分相当于在 50/50 难度的题目上始终回答 50% 的「抛硬币基线」

关键设计是只使用每个模型正确率约 50% 的「难度适宜区间」题目,这样可以剥离纯能力差异,更纯粹地衡量校准水平。

主流模型表现

基准列出了多款主流厂商模型的 Integrity Score(数值越高代表越校准),部分代表性结果如下:

  • Muse Spark 1.2:28.1(最高)
  • Muse Glimmer 30B:24.5
  • Muse Spark 1.1:17.4
  • Claude Opus 5:16.1
  • Claude Opus 4.8:13.6
  • Claude Sonnet 5:13.1
  • Gemini 3.1 Pro:5.7
  • Grok 4.6:-0.7
  • Claude Fable 5:-5.9
  • Kimi K3:-11.5
  • GPT-5.5:-29.5
  • GPT-5.6 Sol:-41.4
  • GPT-5.6 Terra:-57.1
  • GPT-5.6 Luna:-67.0
  • Gemma 4 26B:-71.3
  • Inkling:-75.2
  • Gemini 3.7 Flash:-78.3
  • Gemini 3.5 Flash:-87.8
  • Qwen 3.6:-92.2
  • Gemini 3.6 Flash:-92.2(最低)

可以看到,得分最高的几款模型多来自相对小众或更新的产品线,而头部厂商的旗舰模型则普遍落入深度负值区间,意味着它们在难度适中的题目上「既答错又确信」的问题尤为突出。

典型例题

基准包含 10 个领域的题目,公开页面只展示了其中两类示例:

  • 图像计数:让模型通过两张角度略有差异的图片数清场景中椅子的总数。Gemini 3.7 Flash 给出的答案是 37,而实际为 54,少数 17 把椅子(约占总数三分之一),却同时给出 70% 的置信度。
  • 信念追踪:要求模型在多个人员进出房间、互相交换盒子的复杂事件序列后,给出每个人对每个物体位置的当前信念,需要长期跟踪与心智推理能力。

这些例题显示,错误类型往往并非简单的「知识盲区」,而是模型在未能正确解题的情况下仍然保持高度自信——这正是 Integrity Bench 想突出的风险点。

后续与限制

为避免被针对性微调「刷分」,基准题目在设计上保持闭源,公开页面仅展示少量示例,并附带误差条以反映置信区间。整体而言,Integrity Bench 提供了一个独立于传统知识/推理基准的视角,让行业可以重新审视「模型既答错又言之凿凿」这一普遍现象。

信源