Rails 基金会启动「Agents on Rails」基准测试,对比主流编码 Agent 表现
Rails 基金会联合 Evil Martians 发布首个「Agents on Rails」基准第一阶段结果,覆盖 8…
Rails 基金会近日公布了「Agents on Rails」基准测试项目的第一阶段结果。该项目由基金会委托工程咨询公司 Evil Martians 执行,旨在系统衡量当前主流编码 Agent(包括前沿闭源模型与开源权重模型)在真实 Ruby on Rails 代码库上的实际表现,并将持续更新为社区提供选型参考。
项目背景与动机
随着过去一年编码 Agent 在开发者中的快速普及,模型迭代频繁、token 成本飙升,团队在选型时面临越来越多的不确定性。许多 Rails 开发者反馈,Rails 的「约定优于配置」特性使其与 AI 编码 Agent 配合良好,且具备较高的 token 效率。Rails 基金会董事会也在团队实践中验证了这些感受,但社区一直缺乏超越个人经验的量化证据。「Agents on Rails」正是为了把这一领域的「口碑」转化为可比较、可复现的公开数据。
评估范围与方法
项目分阶段推进,首阶段「Atomic tasks」现已上线。该阶段评测由若干小型、自包含的任务组成,每项任务仅触及单一 API 能力,便于隔离评估模型在具体能力维度上的表现。评测对象覆盖 8 款不同的前沿与开源权重模型,主要采集以下几类指标:
- 任务准确率
- 完成速度
- token 消耗与运行成本
- 是否倾向于调用当前版本的 Rails API
完整方法论已在项目仓库中公开。评测将以「随新模型发布持续运行」的方式长期维护,确保 Ruby 社区能及时获得最新的横向对比与成本/能力权衡信息。每次运行结果会随一份完整报告同步发布,并汇集在 Rails 官网新增的 AI 页面与博客的「Agents」标签下。
后续计划与开源承诺
第二阶段将引入更贴近真实工程场景的任务,包括跨多步的长链路工作、为既有应用添加新功能,以及从零构建完整应用,以更准确地反映 Agent 在生产级协作中的表现。同时,项目的任务集与方法论已先行开源,原始运行数据将随后续报告陆续上传至代码库。Evil Martians 为本项目专门构建的 Ruby 测试框架「lemans」也将面向社区开源,便于其他人复用与扩展。
致谢与社区参与
基金会特别致谢 Evil Martians 团队在测试框架、语料设计与报告撰写上的贡献,并欢迎 Rails 团队就下一阶段应纳入哪些测试场景提出建议,相关反馈可发送至 foundation@rubyonrails.org。
