智谱 GLM-5.3 开源权重发布:后训练驱动,编码与智能体能力显著提升
智谱(Z.ai)发布 GLM-5.3 开源权重模型,基于与 GLM-5.2 相同的基座模型,完全通过后训练实现提升,在编…
智谱(Z.ai)近日在 Hugging Face 平台上线了 GLM-5.3 开源权重模型。与此前版本不同的是,GLM-5.3 沿用了与 GLM-5.2 完全相同的基座模型,所有能力提升均来自后训练阶段的优化,重点增强了复杂编程、长链路任务执行以及网络安全相关能力。
编码能力:自研基准提升 50%,多榜单达到开源 SOTA
在编码方向上,GLM-5.3 表现出了显著的代际跨越。官方披露,模型在 Z.ai 自研的 Code Bench 上较 GLM-5.2 提升了 50%,并在该基准上成为目前最强的开源权重模型。同时,在 Terminal Bench 3.0 与 Agents' Last Exam 两项公开基准上,GLM-5.3 也均达到了开源 SOTA 水平。这意味着 GLM-5.3 不仅在内部评测上领先,在公开、可复现的第三方测试中同样具备竞争力。
- 内部 Z.ai Code Bench:较 GLM-5.2 提升 50%
- Terminal Bench 3.0:开源 SOTA
- Agents' Last Exam:开源 SOTA
智能体与长链路任务:长视野任务能力增强
GLM-5.3 的另一大提升方向是长链路(long-horizon)任务。官方明确将「复杂编程与长视野任务」作为本次迭代的核心目标,暗示模型在多步推理、工具调用以及持续执行复杂任务流的稳定性上获得了实质性改善。结合 Agents' Last Exam 上的开源 SOTA 成绩,可以判断其智能体(agent)能力在开源阵营中已处于第一梯队。
涌现的网络安全能力:攻防链条上能力倍增
值得注意的是,GLM-5.3 在网络安全方向上出现了官方未预料到的「涌现能力」。智谱团队表示,随着后训练规模扩大,模型的网络安全能力发展速度超出预期。在 CyberGym 漏洞发现基准上,GLM-5.3 达到当前最优水平;更值得关注的是,从漏洞发现到利用执行(exploitation chain)的整条链路中,GLM-5.3 较 GLM-5.2 的提升幅度最大,部分利用类基准成绩翻倍以上。
- CyberGym(漏洞发现):达到 SOTA
- 利用链路相关基准:较 GLM-5.2 提升超过 2 倍
部署与资源
社区已提供 GGUF 格式的量化版本,便于在本地或消费级硬件上部署运行,模型仓库地址为 huggingface.co/unsloth/GLM-5.3-GGUF。开发者可直接通过 Hugging Face 获取权重,并按自身需求进行推理或微调。
综合来看,GLM-5.3 是一次「不换基座、纯靠后训练」的迭代范式样本,验证了后训练方法在编码与智能体能力上仍有可观挖掘空间,也为开源社区提供了在多个关键基准上达到 SOTA 的新选择。
