桃子桃子快讯
返回首页
研究论文

Ai2 发布 BenchMIRT:审计大模型评测基准「考了什么」

Ai2 推出评测审计工具 BenchMIRT,发现 BBQ 等社会偏见基准更多区分模型的推理能力而非安全能力。

2026.09.02 · 周三2 分钟阅读

Allen 人工智能研究所(Ai2)近日在 X 平台宣布推出评测审计工具 BenchMIRT,用以检验当前主流大模型(LLM)安全与能力评测基准是否真的在「考它们声称要考的东西」。研究人员利用该工具对 BBQ 等社会偏见类基准进行审计,发现其题目的区分度更多来自模型的推理能力,而非设计初衷所指向的安全或偏见相关能力。

工具定位:审计「评测的评测」

随着各类 LLM 基准不断涌现,业界对其有效性的质疑也随之增加。传统做法是先有基准、后看模型表现;而 BenchMIRT 的思路是反过来「审视基准本身」——分析一道题在大量被测模型上的得分差异主要由哪些能力维度驱动。

  • 输入:一套公开基准的题目与若干模型的回答结果;
  • 输出:每道题对各类能力的「依赖度」画像,例如推理、常识、偏见敏感性等;
  • 用途:帮助研究者和基准设计者识别「名实不符」的题目,从而改进或淘汰偏差较大的评测项。

初步发现:BBQ 更像推理题而非安全题

研究团队以 BBQ(社会偏见问答基准)作为案例进行了实证分析。BBQ 设计目标用于衡量模型在性别、种族等维度上的偏见表现,但 BenchMIRT 的结果显示:

  • 模型在该基准上的得分差异,与「推理能力」的相关性显著高于与「偏见识别 / 安全能力」的相关性;
  • 这意味着模型在 BBQ 上表现更好,可能更多反映其推理或阅读理解更强,而非偏见更少;
  • 因此把 BBQ 分数直接解读为「更安全 / 更少偏见」存在被高估的风险。

对行业的影响与局限

这一发现对当前广泛引用基准排名进行「安全宣称」的厂商和报告提出了警示:如果评测本身混杂了推理等非目标能力,那么分数并不足以证明模型在安全维度上的真实水平。

不过需要指出的是,本次披露的内容仍以社交媒体摘要与图表为主,完整的论文细节、覆盖的基准数量以及方法学描述尚待后续公开。研究者与从业者在引用类似结论时,应结合完整论文再做判断。

小结

BenchMIRT 提供了一个相对务实的「元评测」视角:当一个基准声称衡量安全或偏见时,应当能够证明其分数主要由相应能力驱动。 Ai2 的这一工作,为后续基准的设计与修订提供了一个可复用的审计框架。

信源