GLM 5.3 在 SlopCodeBench 编码基准实测:与 GPT-5.6 Sol、Fable 5 持平
Reddit 用户在 SlopCodeBench 两套题集上测试 GLM 5.3,17 项检查点拿到 8/17,30 项…
Reddit 用户 @corruptbytes 在 r/LocalLLaMA 社区发布了 GLM 5.3 在 SlopCodeBench 编码基准上的完整跑分结果。GLM 5.3 在 30 项严格检查点题集上拿到了 10/30(33.3%),与同题集上的 Fable 5 和 GPT-5.6 Sol 并列第一;同时在 Opus 5 报告所用的 17 项题集上拿到 8/17(47.1%),是这套题集目前的最高分。
基准规则与测试方法
SlopCodeBench 的核心机制是让 AI 一步步搭建一个工具,过程中持续追加新需求,旧需求对应的测试用例会被「隐藏」起来,考察模型在功能扩展时是否会破坏已有功能。据作者描述,目前还没有任何模型完整跑通过整个基准,因此各次测试都尚未「饱和」,仍处于早期阶段。
本次测试有一个小插曲:作者原本只打算跑 9 道题,但误将全部 36 题都跑了一遍,花费约 200 美元,因此最终结果覆盖了之前报告中的全部题目。
多模型横向对比
作者汇总了多款模型在两套题集上的严格通过率:
- 17 项题集(Opus 5 报告):GLM-5.3 8/17(47.1%);DeepSeek V4 Flash 0731 5/17(29.4%);Opus 5 / Claude Code 4/17(23.5%);Qwen3.8-27B 3/17(17.6%);DeepSeek V4 Flash / OpenCode 3/17(17.6%)。
- 30 项题集(Fable / Sol / Kimi 报告):GLM-5.3 10/30(33.3%);Fable 5 / Claude Code 10/30(33.3%);GPT-5.6 Sol / Codex 10/30(33.3%);Kimi K3 / Modal / OpenCode 8/30(26.7%);Kimi K3 / Baseten / OpenCode 7/30(23.3%);Qwen3.8-27B 4/30(13.3%)。
两套题集各有侧重,17 项题集更偏 Opus 5 报告的测试思路,30 项题集则纳入了 Fable、Sol、Kimi 三家的题面。GLM 5.3 在两套题集上分别位列当前已测模型的并列第一。
观察与局限
作者指出一个普遍规律:题目难度越高,模型需要输出的 token 越多,推理成本也随之上升,难度与 token 消耗呈正相关。这也是本次测试花费明显超出预期的原因之一。
需要注意的是,本次结果是单一社区用户在自家环境下的单次跑分,并非官方报告,SlopCodeBench 本身也仍处于「题目未饱和」的阶段,不同模型间的相对差距可能随题集扩充而变化。结论仅供参考,不应作为模型综合能力的唯一依据。
