桃子桃子快讯
返回首页
模型发布

智谱发布 GLM-5.3:编码逼近顶级模型,安全能力升级

智谱开源大模型 GLM-5.3 发布,编码能力逼近顶级闭源模型,并在白盒代码审计中成为最强开源安全模型。

2026.08.14 · 周五4 分钟阅读

智谱正式发布开源大模型 GLM-5.3,主打编码与安全两条主线。在多项主流基准测试中,GLM-5.3 被官方定位为当前排名最高的开源模型,编程与智能体能力接近顶级闭源模型;随着推理预算提升,其编码准确率继续上升,在 High 档位下以更低的 Token 消耗即可超过部分顶级闭源模型最高档位的准确率。

编码能力:接近顶级闭源模型

GLM-5.3 在智谱自家的 ZCode Harness 中接受了多轮实测。第一项任务基于 Karpathy 提出的「指环王基准」:模型需要在完全自主的环境下完成长时间规划、写代码、放置 3D 资产、编排动画,最终交付一个约 90 秒中文旁白的可运行作品。GLM-5.3 用时约 28 分钟完成,同等条件下 GLM-5.2 效果明显落后。

第二项任务进一步加大难度,要求模型在不下载任何手表模型的前提下,完整解构一块 3D 手表的内部结构与空间关系。模型在十几分钟内交付了可在特写镜头下保持细节的结果。

第三项任务则要求模型交付一个可上线的模拟游戏,涵盖前端、后端、数据库、权限、自动化测试与 Docker 构建。模型用时约 40 分钟,最终通过自检输出验收报告:注册登录、数据持久化、跨账号权限隔离、构建与测试均验证通过。

安全能力:白盒审计与漏洞推理

GLM-5.3 在 CyberGym 白盒代码审查基准上取得 84.5%,相比 GLM-5.2 的 77.2% 进一步提升,超过同档其他开源模型,成为当前最强的开源安全模型。

发布前两周,智谱联合清华、南开及多家企业与研究机构,开展密集的红队测试,累计发现漏洞 2404 个(经初筛与去重),其中 1088 个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与协议等 220 个项目,最早的漏洞可追溯至 40 年前。

实测中,GLM-5.3 对一个预埋 12 类漏洞的 Node.js 项目进行了完整审计:明文密码、Stored XSS、Mass Assignment 提权、IDOR、路径穿越等均被识别,散落在不同路由中的 3 个 IDOR 还被合并为同一根因 Finding。后续修复环节中,22 个文件被改动,新增 1463 行代码,并由模型补出回归测试,最终 54/54 项测试通过。

「知道自己不知道」成为安全的一部分

在 Mac 无 GPU 的环境下,模型被要求编写 CUDA 工程。GLM-5.3 先确认本机无法运行 CUDA,随后将任务拆分:CPU 可验证的算法逻辑自行构造模拟测试,CUDA 代码借助 Docker 中的 CUDA Toolkit 通过 nvcc 真实编译,真实 GPU 执行与数值一致性则明确标注为 UNVERIFIED,并未伪造结果。

这一行为本身被智谱视为安全能力的关键组成:能做的尽量做,不能做的明确标注边界,对于正在获得越来越多系统权限的 Coding Agent,「知道自己的证据到哪一步」与「能写代码、能修漏洞」同等重要。

为什么把 Coding 和安全放在一起

智谱将 Coding 与安全并列作为本次发布的两条主线,本质上反映了 Coding Agent 已经从「写一段代码供人使用」演进到「直接读写仓库、调用终端、安装依赖、运行测试、参与部署」。能力越强、可接触的系统越多、获得的权限越高,一次判断失误的后果也会同步放大。

因此,安全正在从上线前的一次审计,逐步前移到「写代码 → 运行 → 测试 → 发现风险 → 修复 → 重新验证」的闭环之中。现实场景中,Hugging Face 在处理一次由自主 Agent 驱动的安全事件时,由于攻击操作包含真实载荷与 C2 痕迹,部分商业 API 会被阻断,最终选择将 GLM-5.2 直接部署在自有基础设施上完成攻击时间线重建——这被智谱视为 Agent 时代安全需求已经出现的标志。

综合来看,GLM-5.3 强调的「生产级 Coding」由四部分组成:能交付完整工程、能通过验证、能标注自身证据的边界、还能主动修复自己写出来的漏洞。技术报告已在 z.ai 博客发布。

信源