研究论文
Ai2 推出 BenchMIRT:可预测模型在未见题目上的答题表现
Ai2 在 X 上介绍 BenchMIRT,对模型未作答的题目,其预测答题正确率的准确率达 79%,优于基线 70%。
2026.09.02 · 周三约 2 分钟阅读
Ai2(非营利研究机构 Allen Institute for AI)在 X 平台介绍了名为 BenchMIRT 的工具。该工具的核心能力在于:即便模型尚未回答过某道题目,也能估算它在这些「未见题目」上的表现。与简单的「基准均值」基线方法相比,BenchMIRT 对模型能否答对的预测准确率为 79%,而基线仅为 70%。
核心数据对比
- BenchMIRT 对模型答题正误的预测准确率:79%
- 简单基准均值基线的预测准确率:70%
- 评估对象:模型尚未作答的 held-out(留出)题目
这一提升说明,在评估一个新模型时,BenchMIRT 不必让模型跑完全部题目,仅凭已有答题数据就能较准确地预判其在剩余题目上的正确率,为评测流程节省算力提供了可能。
意义与局限
BenchMIRT 的方向契合大模型评测中「如何用更少算力得到更可靠的分数」这一长期需求。如果预测能力持续提升,研究者可以用更小子集的答题结果外推全量基准分数,从而降低评测成本。
不过,Ai2 此次仅通过 X 推文披露,公开信息极为有限:未提供论文链接、技术细节、覆盖的具体基准列表、所用模型范围以及 79% 准确率的统计置信区间等关键参数。因此,目前还无法判断该方法在不同任务类型、不同规模模型上的稳定性,也尚不清楚是否已发布代码或权重。后续若有论文或技术博客发布,将有助于更全面地评估其价值。
