Rails 编码 Agent 基准 Stage 2:GPT-6 Astra 以 35% 完成率领跑
Agents on Rails 基准第二阶段发布,10 款主流模型在 Fizzy 应用 20 个真实功能工单上测试,GP…
Agents on Rails 是一个面向 AI 编码 Agent 的实测基准,最新发布的 Stage 2 引入了 20 个针对 37signals 开源看板应用 Fizzy 的「功能工单」,考察模型从需求描述出发、独立交付完整特性的能力。结果显示,即便是表现最好的模型也只能解决 35% 的运行(21/60),揭示了当前 AI Agent 在真实工程任务上仍有显著短板。
核心结果
Stage 2 共有 10 款模型参与评测,按厂商默认 effort 设置运行:
- 准确率最高:GPT-6 Astra(medium),35% 的运行通过(21/60)。
- 成本最低:GLM 5.3 Flash(max),全部 60 次运行仅 18.78 美元,但通过率仅 13%。
- 速度最快:GPT-6 Astra,中位时间 9 分钟/次。
- 综合最优:仍为 GPT-6 Astra,整轮花费 150.47 美元,性价比同样靠前。
需要特别说明的是:GPT-5.6 Luna 单次成本仅 1.69 美元,但 60 次运行 0 次通过;GLM 5.3 Flash 的低总价因此才成为「最便宜」。
两条通往顶部的路径
榜单前两名代表了截然不同的解题风格:
- Gemini 3.8 Flash 走「穷尽式」路线,每轮平均 200 步、27 分钟,把所有可能的路径都跑一遍。
- GPT-6 Astra 走「果断式」路线,仅用十分之一的步骤和极少 token,9 分钟即可完成。
- Claude Fable 5.1 则以高成本换取第二名,「烧钱式」解题。
三类策略的成本差异并不大,但都跑出了有竞争力的成绩,说明「详尽」与「精炼」目前都还有效。
时间与体力的边界
Stage 2 把单次任务上限放宽到 90 分钟、400 步、60 美元。仍然有两款模型频繁撞墙:
- Kimi K3 在 60 次运行中超时 14 次,中位耗时 70 分钟。
- GLM 5.3 Flash 超时 12 次。
两款均为开源权重模型,评测方指出若放宽预算,结果可能改善。其余模型超时次数均不超过 1 次。
「完整」是当前最难的命题
即便是榜首模型,也难以交付「完整」特性。以「立刻上线日语支持」为例:
- 仅 Claude Fable 5.1 的 1 次运行真正达成了「完整」。
- 其他模型通常翻译可见部分、跑通自有测试即提交;少数则在时限内仍在翻译。
评测方指出,模型缺乏对「完整」的判断机制——需求里没写,就不知道要做。
Stage 1 明星 Luna 在 Stage 2 全军覆没
Stage 1 中表现惊艳的 GPT-5.6 Luna(63 个工单通过 46 个,成本仅 0.9 美元)在 Stage 2 上 60 次运行 0 次通过。差距来自任务规模的跃迁:
- 原子级任务允许「猜」——提交半成品或跳过测试集,影响有限。
- 功能级任务需要高层级规划,不做规划或无法规划的小模型无法交付。
评测方法
- 语料:20 张 Fizzy 功能工单,每张附带相关性、难度与考察点的说明。
- 预算:90 分钟 / 400 步 / 60 美元每次运行。
- 运行框架:lemans 与 miniswen,与 Stage 1 一致。
- 评判:Fizzy 自有测试套件 + 评测方自建的隐藏校验项(需先还原测试目录再验证)。
- 已知局限:均为厂商默认 effort(max effort 横扫测试即将推出);无 Agent 脚手架、无联网;每题 3 次尝试(k=3)。
下一步:Stage 3
评测方预告 Stage 3 将考察「跨会话延续」的能力——Agent 能否在多次会话中基于自身既有产物继续构建。具体形式包括「From Zero to IPO」等场景,相关细节尚未公开。
