SWE-rebench 排行榜新增多语言:GLM-5.2 与多款开源模型实测
社区基准 SWE-rebench 加入 Go、Java、Python、Rust、TypeScript 多语言实测,多款开…
面向本地大模型开发者的软件工程基准 SWE-rebench 近日发布了一次重要更新,把评测范围从单一 Python 扩展到 Go、Java、Python、Rust、TypeScript 五种语言,并基于真实工程任务对多款主流开源权重模型进行了重新打分。
多语言扩展意味着什么
本次更新最大的变化是引入了多语言切片(multilingual slice),覆盖了实际软件工程中常见的五种语言栈。这意味着模型不再只在 Python 任务上接受检验,而是要在跨语言、跨生态的真实 issue 上展现能力。对于需要在本地部署编码智能体(coding agent)的开发者来说,这一基准的参考价值比纯 Python 评测更高。
主要模型 Pass@1 成绩
下表列出了官方公布的 Pass@1、Pass@5 与五项任务全部通过的比率(数据来源:SWE-rebench 排行榜)。
- GLM-5.2 [high]:Pass@1 为 62.9%(±1.19%),Pass@5 为 81.1%,五项全通率为 39.6%。
- MiniMax M3:Pass@1 为 47.2%(±1.13%),Pass@5 为 69.4%,五项全通率为 20.7%。
- MiMo V2.5 Pro:Pass@1 为 46.5%(±0.54%),Pass@5 为 65.8%,五项全通率为 27.0%。
- DeepSeek-V4 Pro [high]:Pass@1 为 40.2%(±1.29%),Pass@5 为 64.0%,五项全通率为 13.5%。
- Qwen3.6-27B:Pass@1 为 31.2%(±1.68%),Pass@5 为 57.7%,五项全通率为 10.8%。
- Qwen3.6-35B-A3B:Pass@1 为 24.7%(±0.79%),Pass@5 为 43.2%,五项全通率为 8.1%。
- Qwen3.5-35B-A3B(参考基线):Pass@1 为 17.1%,Pass@5 为 36.9%,五项全通率为 3.6%。
从数字看,GLM-5.2 [high] 在多语言软件工程任务上明显领先,Pass@1 比第二名高出约 16 个百分点;而 Qwen3.5-35B-A3B 作为参考基线被纳入,主要用于对比同一架构在版本演进中的提升幅度。
下一轮重点:本地可部署模型
据排行榜维护者透露,下一次更新预计在 3–4 周后进行,主题将聚焦于适合本地部署的模型。已确定的候选名单包括 MiMo V2.5、North Mini Code、Laguna S2.1 等,并欢迎社区在评论区提名更多正在用于本地软件开发或编码智能体的模型。
资源与数据集
除了排行榜主页,社区还提供了配套材料:
- 完整分析与轨迹数据:发布在 X(原 Twitter)账号 @ibragim_bad 的推文。
- Harbor 数据集:可在 Harbor Framework Hub 下载 swe-rebench-leaderboard 数据集,供开发者自行运行智能体复现任务。
- Discord 讨论群组:用于持续反馈与模型提名。
整体来看,这次更新把 SWE-rebench 从「Python 编码基准」升级为「多语言软件工程基准」,并给出多款开源权重模型的具体数字,对关注本地编码智能体选型的开发者具有一定参考意义。
