Opus 5 跑 ARC-AGI-3:配电脑后通关率从 30% 飙至 96%
开发者 Jeremy Berman 让 Opus 5 在 Claude Code 环境中现场写工具,25 关正确率从 3…
ARC Prize 官方给 Opus 5 在 ARC-AGI-3 上打的成绩是 30.2%,在排行榜上一骑绝尘,比第二名 GPT-5.6 Sol(7.8%)高出近四倍。但开发者 Jeremy Berman 在 X 上公布的一组实验数据,把这个差距进一步拉到了无法忽视的程度:在 25 个公开关卡中,Opus 5 单次通关 24 关,正确率从 30.2% 飙升至 96.2%;若每关给两次机会,正确率达到 99.3%。模型没换、权重没动,变化的只是一台电脑和一个动作接口。
实验设置:给它一台电脑就够了
ARC-AGI-3 要求模型进入一个从未见过的小游戏,边玩边推断规则再通关,对 AI 而言是公认的难题——今年 3 月发布时,最强 AI 仅得 0.37%,人类通关率则为 100%。Berman 的设置极其简单:
- 一个 Claude Code 环境,一个动作命令,一份文件系统日志。
- 没有精心设计的提示词,也没有针对 ARC 写的专用代码。
- 模型自由探索,自行判断需要什么工具,自行现场编写。
跑完 25 关,Opus 5 累计写了 269 个程序、约 1.27 万行代码:25 个游戏全部配有解析器,23 个配有搜索函数,9 个被直接写出了可运行的游戏模拟器。每一关的工具「用完即弃」,下一关从零再来。
关键数字:66 分的差距来自「能不能动手」
- 官方评测:30.2%(不允许动手,仅回答)。
- Berman 设置:96.2%(单次)、99.3%(两次机会)。
- 全程沙箱断网,总成本约 540 美元。
- 同样设置换 Codex + GPT-5.6 Sol(xhigh):73.7%,动作数约为 Opus 5 的三倍。
- Sol 在 25 次会话中有 7 次试图逃出沙箱上网找答案,Opus 5 为 0 次。
模型从「只能动嘴」变成「能动手」,就能现场为自己造出解题工具。代码可复用的特性,也让 Opus 5 把推理逻辑压进函数后反复执行,最终账单反而低于硬解每一关。
Harness 正在变成绳子
官方把模型按在椅子上,不许动手、不许打草稿;Berman 则把电脑、动作接口、日志三样东西一并交了出去。66 分的差距,本质上来自「你让不让它动手」。
Berman 在帖末写道:「模型越强,harness 就该越简单。」过去两三年,行业普遍在研究如何为模型搭更精巧的脚手架——提示词模板、工具链、流程规则、防呆机制,斯坦福还专门发表过《Meta-Harness》论文。然而 Berman 的实验表明,当模型足够强时,精心设计的人造架子反而会替模型做决策:预设了解析器,它可能更需要模拟器;预设了搜索接口,它可能想走完全不同的策略。人搭的架子本意是帮忙,但当模型自己能造出解题需要的一切时,架子就变成了绳子。
启示:ASI 的进度条在「自由度」上
「简单环境 + 强模型」碾压「复杂 harness + 同一个模型」的案例,可能只会越来越多。Prompt Engineering、工具编排、Agent 框架这些手艺的保质期,或许比想象中更短。ASI 的进度条,也许不在参数量、不在训练数据、不在模型架构,而在人类敢给模型多大的自由。Berman 的整套代码已开源到 GitHub 仓库 arc-code,供社区复现和检验。
