ARC-AGI-3 求解:可执行世界模型、简化与验证的消融研究
通过四种 Codex Agent 变体在 ARC-AGI-3 公开题上的消融实验,发现完整验证机制在多数设置下效果最佳。
一项发表于 arXiv 的研究针对 ARC-AGI-3 Agent 的核心组件进行系统性消融,回答「可执行世界模型、计划简化与精确重放验证」三者中,究竟哪一部分真正驱动了性能。该团队此前推出的 ARC-AGI-3 Agent 同时整合了这三项能力,但一直缺乏归因分析。
实验设计:四种嵌套变体
研究者构建了四个由简到繁的 Codex 类 Agent 变体,在同一基线框架下逐层加入组件:
- 纯文本基线:仅使用文本接口,不维护可执行世界模型。
- 灵活接口的可执行世界模型:加入可执行世界建模,但去掉精确重放验证。
- 可执行模型 + 计划简化:在前者基础上加入 scheduled simplification(按计划对推理进行简化)。
- 固定接口的完整验证:保留简化机制,并要求精确复现已记录观测,是最严格的处理。
主研究在 ARC-AGI-3 公开题目上,使用 gpt-5.4 与 gpt-5.5,分别在高(high)与极高(xhigh)推理强度下评估全部四个变体。后续探索实验改用 gpt-5.6-sol,在 xhigh 与 max 推理强度下重新评估文本变体与验证变体。
主要发现
实验得到几条相对稳健的结论:
- 更强的模型与更高的推理强度始终带来提升:在所有四个变体中,这一趋势都成立,是本文最稳健的结论。
- 变体间差异小于预期:在固定的模型与推理强度设置内,不同组件的贡献差距不大,且各组件的效果会随设置变化。
- 可执行交付并非普遍有益:在 gpt-5.5 的两种推理强度下,纯文本变体反而优于灵活接口的可执行变体,说明维持可执行产物不一定带来收益。
- 简化在多数设置下有效:计划简化在四种「模型-推理强度」组合中的三种里带来性能提升,仅在最弱设置中例外。
- 完整验证始终领先:固定接口的验证变体在全部四种主实验设置中均排名第一,但代价是显著更高的资源消耗。
gpt-5.6-sol 探索:公开集合上接近饱和
在后续探索中,使用 gpt-5.6-sol 并开启 xhigh 或 max 推理强度时,验证变体在所有公开 ARC-AGI-3 题目上实现了完全求解,RHAE 指标达到约 99%,且所用动作总数不到人类基线的一半。
研究者明确指出该结果应谨慎解读:gpt-5.6-sol 的训练数据晚于这些公开题目,尚未在留出(held-out)题目上验证,因此只能视为「公开集合饱和」,尚不足以宣称在 ARC-AGI-3 上达到普遍意义上的 AGI 水平。
启示与边界
该研究的价值在于把 ARC-AGI-3 Agent 的成功归因拆解开来,为后续 Agent 架构设计提供了经验依据:在更强的模型和更高的推理强度面前,部分复杂组件的可执行性收益会被压缩,而严格的验证机制仍是当前最稳健的提升手段。但其结论主要建立在公开题目与特定模型版本之上,能否推广至未见过的 ARC-AGI-3 题目仍是开放问题。
