桃子桃子快讯
返回首页
工具

Rails 编码 Agent 基准 Stage 2:GPT-6 Astra 以 35% 完成率领跑

Agents on Rails 基准第二阶段发布,10 款主流模型在 Fizzy 应用 20 个真实功能工单上测试,GP…

2026.09.12 · 周六4 分钟阅读

Agents on Rails 是一个面向 AI 编码 Agent 的实测基准,最新发布的 Stage 2 引入了 20 个针对 37signals 开源看板应用 Fizzy 的「功能工单」,考察模型从需求描述出发、独立交付完整特性的能力。结果显示,即便是表现最好的模型也只能解决 35% 的运行(21/60),揭示了当前 AI Agent 在真实工程任务上仍有显著短板。

核心结果

Stage 2 共有 10 款模型参与评测,按厂商默认 effort 设置运行:

  • 准确率最高:GPT-6 Astra(medium),35% 的运行通过(21/60)。
  • 成本最低:GLM 5.3 Flash(max),全部 60 次运行仅 18.78 美元,但通过率仅 13%。
  • 速度最快:GPT-6 Astra,中位时间 9 分钟/次。
  • 综合最优:仍为 GPT-6 Astra,整轮花费 150.47 美元,性价比同样靠前。

需要特别说明的是:GPT-5.6 Luna 单次成本仅 1.69 美元,但 60 次运行 0 次通过;GLM 5.3 Flash 的低总价因此才成为「最便宜」。

两条通往顶部的路径

榜单前两名代表了截然不同的解题风格:

  • Gemini 3.8 Flash 走「穷尽式」路线,每轮平均 200 步、27 分钟,把所有可能的路径都跑一遍。
  • GPT-6 Astra 走「果断式」路线,仅用十分之一的步骤和极少 token,9 分钟即可完成。
  • Claude Fable 5.1 则以高成本换取第二名,「烧钱式」解题。

三类策略的成本差异并不大,但都跑出了有竞争力的成绩,说明「详尽」与「精炼」目前都还有效。

时间与体力的边界

Stage 2 把单次任务上限放宽到 90 分钟、400 步、60 美元。仍然有两款模型频繁撞墙:

  • Kimi K3 在 60 次运行中超时 14 次,中位耗时 70 分钟。
  • GLM 5.3 Flash 超时 12 次。

两款均为开源权重模型,评测方指出若放宽预算,结果可能改善。其余模型超时次数均不超过 1 次。

「完整」是当前最难的命题

即便是榜首模型,也难以交付「完整」特性。以「立刻上线日语支持」为例:

  • 仅 Claude Fable 5.1 的 1 次运行真正达成了「完整」。
  • 其他模型通常翻译可见部分、跑通自有测试即提交;少数则在时限内仍在翻译。

评测方指出,模型缺乏对「完整」的判断机制——需求里没写,就不知道要做。

Stage 1 明星 Luna 在 Stage 2 全军覆没

Stage 1 中表现惊艳的 GPT-5.6 Luna(63 个工单通过 46 个,成本仅 0.9 美元)在 Stage 2 上 60 次运行 0 次通过。差距来自任务规模的跃迁:

  • 原子级任务允许「猜」——提交半成品或跳过测试集,影响有限。
  • 功能级任务需要高层级规划,不做规划或无法规划的小模型无法交付。

评测方法

  • 语料:20 张 Fizzy 功能工单,每张附带相关性、难度与考察点的说明。
  • 预算:90 分钟 / 400 步 / 60 美元每次运行。
  • 运行框架:lemans 与 miniswen,与 Stage 1 一致。
  • 评判:Fizzy 自有测试套件 + 评测方自建的隐藏校验项(需先还原测试目录再验证)。
  • 已知局限:均为厂商默认 effort(max effort 横扫测试即将推出);无 Agent 脚手架、无联网;每题 3 次尝试(k=3)。

下一步:Stage 3

评测方预告 Stage 3 将考察「跨会话延续」的能力——Agent 能否在多次会话中基于自身既有产物继续构建。具体形式包括「From Zero to IPO」等场景,相关细节尚未公开。

信源