桃子桃子快讯
返回首页
行业动态

Ox Alpha 自测跑分 SWE-bench Mini 达 96%,作者提醒或偏高

用户用 mini-swe-agent 框架在 50 任务子集上测得 Ox Alpha 96% 通过率,但作者自行指出子集…

2026.08.22 · 周六4 分钟阅读

一名开发者在 Reddit r/LocalLLaMA 板块公布了对模型 Ox Alpha 的 SWE-bench Verified Mini 基准自测结果:在 50 个任务的子集上取得 48/50、即 96% 的解析率。但作者本人也在文中强烈提示该数字很可能是「上限」,读者应谨慎看待。

测试设置

测试沿用了 SWE-bench 官方榜 swebench.com 使用的 mini-swe-agent 框架(v2.4.6),prompt 与工具调用配置几乎原样保留,仅替换为指向 Ox Alpha 的接口,单次运行步数上限 250。

评测对象为 swe-bench-verified-mini,即 SWE-bench Verified 全集中常见的 50 任务子集,主要来自 django 与 sphinx-doc 两个代码库。判定使用官方 SWE-bench Docker harness,必须全部 FAIL_TO_PASS 与 PASS_TO_PASS 测试通过才计为解析成功。运行环境为一台 Windows 11 + Docker Desktop (WSL2),4 个并行容器。模型通过 opencode 的 Go 网关访问,属 free-tier。

关键结果

  • 解析数:48 / 50,通过率 96.0%。
  • 失败样本:django__django-11790、django__django-11815。
  • 空补丁或错误:0 起,50 个任务都提交了实际改动。
  • 平均步数 40,最大 116。
  • 总耗时约 2 小时 4 分钟(4 路并行)。
  • 分库成绩:django 23/25,sphinx-doc 25/25。

与主流模型的对比

Swebench.com 上 Bash-Only 榜单使用与该用户完全相同的 mini-swe-agent 脚手架,因此可比性最强;厂商自报则多采用自家调优的 agent 框架。

  • 同一 Bash-Only 脚手架下,Claude Opus 4.6 (2026 年 3 月) 为 75.6%,Claude 4.5 Opus 高推理为 76.8%,Gemini 3 Flash 高推理为 75.8%,GPT-5.2 为 72.8%。
  • 厂商自报方面,Claude Opus 4.8 (2026 年 5 月) 为 88.6%,GPT-5.5 (2026 年 4 月) 为 82.6%,Claude Opus 4.6 为 80.8%。
  • 作者引用的 Claude Fable 5 (2026 年 6 月) 在厂商调优 agent 下为 95.0%。

值得注意的是,其他模型的数字基本是在完整 500 任务、覆盖 12 个仓库的版本上跑出的,而此次自测仅覆盖 50 任务、2 个仓库,子集明显更窄。

为什么这个 96% 应被打折

作者自己也列出了若干必须警惕的点:

  • 子集偏窄且偏代表性:Mini-50 只包含 django 与 sphinx 两个仓库,二者在 LLM 训练语料中曝光度极高,存在「背题」/ 污染放大得分的可能。
  • 样本量太小:n=50,仅统计噪声就在 ±3 个百分点左右。
  • 任务陈旧:均为 2019–2022 年的 PR,新模型在训练中大概率见过。
  • 免费端点不可控:无法确证服务端是否做了缓存、限流或路由干预。
  • 基线不可直接对比:72–77% 的前沿数字来自完整 500 任务集,本次的 96% 是更易子集上的上限值。

作者也提到,HAL 榜单同样使用该 Mini-50 数据集但采用不同脚手架,目前榜首约 72%(SWE-Agent + Claude Sonnet 4.5,老一代),侧面印证这并非「最简单的 50 题」。

小结

按现有信号,Ox Alpha 在 agentic coding 上确实展现出第一梯队水平;不过在看到其在完整 500 任务、12 仓库下的 bash-only 成绩之前,96% 应当被视作上界,而非可与 Claude 4.5 Opus 或 Claude Opus 4.6 直接比较的数字。作者表示愿意公开配置、轨迹与评分报告供社区复核。

信源