29 个 AI 编程模型的成本与质量基准
独立研究在统一条件下测试 29 个 AI 编程模型,评估其在代码生成任务中的表现与成本,总花费 932 美元。
一项覆盖 29 个 AI 编程模型的独立基准研究近日在 Hacker News 上公布结果。研究团队为每个模型提供了完全相同的 60 条请求,使用相同的智能体框架和工具链,并在 13 类编程任务上展开测试,试图勾勒出当前 AI 编程工具的「成本—质量」分布图。整个项目最终花费 932.15 美元。
测试设计
研究采用了「同条件对照」思路:每个模型都被部署为智能体,配备相同的工具,并在隔离的代码副本上运行。其中 34 次测试针对 11 个开源任务队列项目(asynq、Celery、Resque、Laravel、Oban、BullMQ、Quartz、Pekko、Taskflow、MassTransit、Apalis),均锁定到固定 commit;另有 26 次测试运行在 11 种语言编写的私有项目上,避免被训练数据污染。
研究者在每条请求中统一加入了一句话指令:「不要向我提出澄清问题。如果存在歧义,请选择最合理的解释,用一行说明你的假设,然后继续完成任务。」这一设定的理由是:现实中对方往往已经离席,反复追问只会让工作无限期搁置。
评分机制
每项任务满分 1 分,部分完成得 0.5 分。评分标准在模型运行之前就已全部写好。60 项任务中:
- 28 项对照真实结果打分:其中 21 项通过运行模型生成的代码对比预验证测试(已知正确与已知错误答案),7 项在代码中植入特定缺陷,检验模型能否发现。
- 32 项由 AI 评审员打分:使用 claude-opus-5 在本地命令行会话中依据预写标准进行评判,评审员能看到模型引用的文件和 diff,可对代码声明进行核查而非仅凭信任。
为防止偏见,模型名称在评审前被剥离,每个判断都运行在独立会话中。由于评审员本身也是被测模型之一,它也对自身参与的 45 项评审进行盲评。在 174 项同时经过人工测试与 AI 评审的答案中,两者一致率为 78%;所有分歧都是评审员判错——它从未放过一个测试失败的答案,但偶尔会否决测试通过的答案。
成本计算
每次运行的 token 消耗按四个类别记录:新鲜输入、缓存写入、缓存读取、输出,按 2026 年 9 月核对的厂商公开目录价计费,不含批量折扣、协议价或免费额度,模型自身的子智能体所用 token 也计入总成本。OpenAI 的用量报告将未缓存输入标记为缓存写入但不收费,因此按输入价计费;Gemini Flash 系列在 2026 年 12 月 31 日前享受促销价,gpt-5.6-sol 至少在 11 月 21 日前亦如此。用量为精确数字,未来任何时候都可按当前费率重新计算。
记忆能力测试
研究还设计了记忆维度:每个模型被告知 10 条规则,其中 5 条在会话开始时给出,另外 5 条在会话进行到模型自身上下文超限、不得不压缩历史之后再行询问。研究者人工分类丢失规则是被模型「承认遗忘」还是被「编造」以掩盖遗忘。
噪声与局限
每个模型对每项任务只运行一次。重跑同一组任务会使分数浮动约 2 分,约每 4 个判断中就有 1 个在「通过」与「部分通过」之间翻转。因此,单次分数的误差区间约为 ±2 分,相差 3–4 分以内的两个模型实际可视为并列。
研究者在文中明确列出三点引用数字前应了解的注意事项:
- 开源项目很可能已出现在模型的训练数据中,模型有时可能是在「回忆」而非真正工作。
- 私有项目不在训练集内,那些任务完全通过运行代码打分。
- 单次运行的噪声意味着 1–2 分的差距没有统计意义,整体趋势比任何单格数据更可靠。
研究团队还发布了配套文章《拥挤的 AI 前沿对工程团队意味着什么》,围绕该数据集讨论了团队在选型时应关注的维度。
