Rails 发布 AI 编码评测套件,主打低 token 与高准确率
Rails 团队推出开源 AI 评测框架,比较多款主流模型在 Rails 任务上的准确率、token 消耗与 API 召…
Ruby on Rails 团队发布了一篇以「Rails Is Built for AI」为主题的长文,核心主张是 Rails 的「约定优于配置」传统,使其天然适合 AI 编码 Agent:标准化的命名、目录、命令和模式让生成代码更贴近惯用写法,减少对提示词的依赖;Ruby/Rails 表达产品逻辑所用 token 更少,使 Agent 单次编辑更小、从需求到可用功能的迭代更快;数十年的公开 Rails 代码构成高质量训练语料,覆盖 controller、model、view、test、job、migration 等典型结构;再加上 Rails 自带完整产品技术栈,单人开发者配合 AI Agent 即可独立完成更大范围的工作。
跨模型 Rails 评测套件
文章同步上线了一个开源 Rails AI 评测套件(链接指向 Explore the open-source Rails AI evaluation suite),用于横向比较不同大模型在 Rails 编程任务上的表现。可视化页支持滑动对比所有模型指标,主要包括:
- 准确率(Accuracy):越高越好,指通过隐藏测试的运行占比
- 单次运行平均 token 数(Mean tokens per run):越低越好
- 单次运行耗时(Speed):取中位数
- 单次运行成本(Cost):取均值
- API 召回(API recall):模型在运行中直接命中目标 Rails API 的比例
评测方法
每个模型对每项评测在 2026 年 8 月期间各跑 3 次,共 63 次/模型。评测使用各 provider 的默认设置;拒绝回答(refusals)记为失败;模型间几个百分点的差异属于运行间噪声。模型层中位数由运行层数据汇总,因此与逐项评测时序可能略有出入,点击任意模型或结果可查看底层评测明细。
来自 Rails 社区的背书
文章引用了多位知名 Rails 开发者的观点强化论点:David Heinemeier Hansson(@dhh)认为「约定优于配置为 20 多年的优质训练数据铺好了路,既让 Agent 表现优秀,也让人类能快速自信地审阅输出」;Marc Köhlbrugge(@marckohlbrugge)表示在 LLM 辅助编程早期就观察到 Rails 项目下输出质量明显更好,因为大多数 Rails 代码库结构相似且整体质量较高;Ivan Morgillo(@hamen)则把「贴近 Rails 默认值」称为 AI 时代的杀手级特性,认为能让开发速度提升约 100 倍。
一点说明
本次抽取的正文未包含评测表格中的具体模型名称与对应数字,因此文章传达的主张仍以方法论与社区证言为主,量化对比细节需访问原文中开源评测套件的可视化页面查看。
