桃子桃子快讯
返回首页
研究论文

StateSight:面向视觉语言模型的空间状态重建基准

arXiv 发布 StateSight 基准,通过立方体展开图、遮挡计数等任务评估 VLM 空间推理能力,GPT-5.5…

2026.08.24 · 周一3 分钟阅读

Vision-Language Model(VLM)在多模态问答中表现日益强大,但其从单张图像重建潜在空间结构的能力一直难以单独评估——主流基准往往将感知、OCR、领域知识、语言先验与推理混杂在同一评分口径下。arXiv 最新论文 StateSight 提出了一套程序化生成的空间推理基准,将空间状态重建能力从其他干扰因素中隔离出来进行精确测量。

基准设计与任务

StateSight 包含三个任务族,每族各有 300 道单图提示,所有标签均由确定性算法生成并采用精确匹配评分:

  • 立方体展开图对位推理:要求模型判断立方体展开图中相对面的配对关系。
  • 遮挡立方体塔计数:模型需根据部分可见的立方体堆叠推算整体数量。
  • 四邻域连通分量计数:在网格图像中识别连通区域的数量。

所有任务样本通过程序化合成,确保标签可验证、可批量扩展,从而把空间结构重建能力与 OCR、领域知识等混杂因素隔离开来。

模型表现

研究团队使用 API 标识 gpt-5.5 调用 OpenAI GPT-5.5,在三任务上分别取得 59.3%、33.3% 与 28.3% 的准确率;Anthropic 的 Claude Sonnet 5 对应结果为 53.3%、18.7% 与 7.3%。所有最终直接运行的输出均未出现格式错误,意味着失败并非源自输出解析,而是源自空间结构本身未被正确恢复。

人类基线对比

在 60 题子集上,30 名人类参与者平均准确率达到 80.8%、68.8% 与 64.3%,在三项任务上均明显超越两个前沿 VLM。人类与模型之间的差距在遮挡立方体计数与连通分量计数上尤为悬殊,揭示当前模型在需要从二维图像反推三维或组合结构方面仍存在显著短板。

可见推导分析(visible-derivation analysis)进一步发现,模型的反复错误集中在图像状态重建与后续推理两个环节,表明格式合规的输出可能掩盖视觉推底层面的失败。

配套数据集 StateSight-Steps

为支持训练与过程级评估,作者同时发布了 StateSight-Steps 数据集,包含 900 个图文交错样本与 3,600 个确定性中间视觉状态。该数据集既可用于训练模型生成显式空间推理步骤,也可作为过程级监督信号,帮助研究者定位模型在哪一推理环节出错。

研究意义

StateSight 强调了一个常被忽视的现象:模型能够输出格式合规的答案,并不意味着其完成了对图像底层空间结构的可靠重建。该基准为面向空间推理的 VLM 评测提供了一套程序化、可扩展的工具,对未来多模态推理研究具有参考价值。

信源