新基准测试暴露多模态AI推理短板:GPT-4o、Gemini 2.5 Pro不足10%
arXiv新研究提出「The Unwritten Benchmark」,仅凭笔声与手部视频推断书写内容,人类准确率超80…
arXiv 上新近发表的一项研究提出了一项名为 The Unwritten Benchmark 的全新多模态基准测试,专门用于评估 AI 模型的抽象感知推理能力。研究者设计了一个被称为「声学–运动学文字推断」(acousto-kinematic word inference)的任务:模型只能依据笔尖在纸面摩擦产生的声音,以及手部书写动作的视频,在完全看不到任何墨迹的前提下,识别出正在书写的文字内容。该基准覆盖三种不同书写风格,旨在考察模型从动态、生成式过程中推断未见信息的能力。
核心发现:人与模型差距悬殊
实验结果显示,人类参与者在有序字母准确率指标上达到 80% 以上,而包括 GPT-4o 和 Gemini 2.5 Pro 在内的领先多模态大模型,准确率均未能突破 10%。这一巨大反差说明,当前主流模型在跨模态因果推理,尤其是在这种需要从细微感知信号重建书写过程的认知任务上,仍存在根本性局限。
反直觉的「悖论式融合」效应
研究还揭示了一个值得警惕的现象:向模型同时提供音频与视频两种模态时,性能反而比仅使用单一模态更差。研究者将这一现象称为「悖论式融合」(paradoxical fusion effect),表明模型在综合互补感知线索方面存在底层缺陷——多种信号的叠加不仅没有带来增益,反而干扰了模型的判断能力。这一发现暗示,大模型在面对动态生成式的多源信息整合任务时,其多模态融合机制尚未成熟。
研究意义与启示
研究者指出,该基准揭示了当前多模态模型在微观运动学理解上的不足。人类可以借助极少感知信号——甚至只凭听觉——还原完整书写过程,而现有 AI 系统在面对这种依赖直觉式感知与认知的任务时仍然力不从心。论文认为,抽象感知推理是大模型迈向更通用智能的关键短板之一,亟需后续工作在跨模态因果建模与感知-认知融合方向上取得突破。
