桃子桃子快讯
返回首页
研究论文

Kimi 发布 PerceptionBench:聚焦视觉感知原子能力评测基准

Moonshot AI 旗下 Kimi 团队推出视觉感知评测基准,从 42 项评测的失败案例中提炼 10 项原子感知能力…

2026.07.28 · 周二2 分钟阅读

Moonshot AI 旗下 Kimi 团队近日在 X 平台宣布,正式发布视觉感知评测基准 PerceptionBench。该基准旨在将多模态模型的视觉感知能力拆解为若干「原子能力」进行独立评估,而非采用综合推理或外部知识介入的考核方式。

基准设计思路:从失败案例反推原子能力

PerceptionBench 的核心方法论与多数现有视觉评测不同:研究者并非预先定义感知能力清单,而是系统梳理当前前沿模型在 42 个视觉相关基准上的失败模式,从失败分布中归纳出模型反复出错的底层能力维度,最终提炼出 10 项「原子感知能力」。

这种「自下而上」的能力发现路径,使得基准更贴近模型当前的真实短板,而非评测设计者的主观分类。

数据规模与题目要求

基准共包含 3000 道经过人工核验的题目,每道题被设计为:

  • 独立考察单项原子感知能力,避免多种能力混淆;
  • 可「凭观察」直接作答,无需推理或调用外部知识;
  • 配套有详细的题目来源与答案校验流程,确保评测可信度。

资源开放与社区影响

团队同步释出了配套资源:官方博客详细说明基准的构建方法与初步实验结果;GitHub 仓库提供评测代码与数据加载脚本;HuggingFace 页面托管数据集,便于研究者复现与扩展。

对于正在推进多模态模型视觉编码器改进的研究团队而言,PerceptionBench 提供了一套更精细的诊断工具,可定位模型在具体感知维度(如计数、空间关系、纹理判别等)上的薄弱环节,而非仅给出一个综合准确率数字。该基准能否被社区广泛采纳,仍有待后续多模型横评检验。

信源