桃子桃子快讯
返回首页
模型发布

智谱 GLM-5.3 登场:能力更强,为何没能复制前代热度

智谱发布旗舰模型 GLM-5.3,编程与网络安全能力显著提升,但发布当天股价反而下跌,市场讨论度不及前代。

2026.08.24 · 周一5 分钟阅读

8月14日,智谱发布新一代旗舰模型 GLM-5.3,8月19日 API 正式开放调用,定价与 GLM-5.2 持平。模型沿用 GLM-5.2 基座,主要通过扩大后训练规模提升编程、长程 Agent 和网络安全能力,权重将于发布后下周五开源,并已向全部 GLM Coding Plan 用户开放,ZCode、Claude Code、OpenCode 等主流编程工具同步接入。

从测试成绩看,GLM-5.3 进步明显。在 Artificial Analysis 综合智能指数中拿到 60 分,进入全球前沿模型区间,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰处于同一档,并与月之暗面 Kimi K3 并列开源模型第一。按 Artificial Analysis 统计的单任务成本,GLM-5.3 在同档模型中属于低成本选手。

然而,这次发布没有重现前代的市场热度。GLM-5.1 发布当天智谱股价上涨 11.5%,GLM-5.2 发布时又涨 32.8%,而 GLM-5.3 发布当天股价反而下跌 3.6%。更强的能力没有带来更强的市场反应,这一反差成为观察国产大模型迭代节奏变化的一个切口。

能力提升:编程与网络安全

GLM-5.3 的升级重点落在后训练环节。智谱没有重新训练一个更大的基座模型,而是让现有模型在更复杂、更贴近真实工作的环境中反复训练,把已有能力「练深」。

支撑这轮后训练的工程改进包括:

  • IndexShare:降低长上下文计算成本
  • SAO:单条任务完成后即可进入训练,不必等整批任务结束
  • slime 框架:把模型执行任务与根据结果更新模型两个环节拆开运行,减少任务耗时差异造成的算力闲置

效果首先体现在编程能力上。基准成绩显示:

  • 长程软件工程基准 DeepSWE v1.1 从前代 46.2 分提升到 66.9 分
  • 智谱自有 Code Bench 最高难度下,GLM-5.3 用约 7.5 万输出 Token 取得 34.5% 成绩,前代需约 9.6 万 Token 仅得 23.4%
  • 完成率提高的同时 Token 消耗下降,说明模型学会了更高效地探索任务,而非靠堆更长的思考时间换成绩

网络安全能力的进步更为明显。漏洞利用推理基准 ExploitBench 从前代 24.4% 提升到 54.4%,翻了一倍多。从 GLM-5.2 起,智谱联合国内多家安全机构用模型持续寻找真实项目漏洞;到 GLM-5.3 发布时,累计发现 2436 个漏洞,覆盖 269 个项目,其中 1097 个为中高危问题,部分漏洞已存在数十年。

为何没能成为「爆款」

模型更强却未引发同等规模的传播,核心原因有三点:

  • 方向偏专业:升级聚焦编程与网络安全,受众相对集中,与用户在智谱创始人唐杰 X 平台征集意见时呼声较高的视觉、多模态方向存在错位
  • 发布节奏密集:仅智谱一家保持约两个月一次的旗舰迭代,7 月至 8 月 Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro 接连发布,第一的窗口期越来越短
  • 同质化竞争加剧:Coding、Agent、长上下文、多模态成为各家共同投入方向,能力趋同,差异化空间收窄

同期 DeepSeek V4 Pro 正式版发布时同步开源首款 Harness 产品,靠「一切皆插件」的新玩法造出新话题;GLM-5.3 虽能力提升扎实,却没有等量的话题点加持。

商业化:从 API 到产品

比传播热度更值得关注的是商业模式演进。GLM Coding Plan 是模型能力、用户调用与收入之间联系最紧密的场景,开发者付费意愿明确,是 API 增长最快的业务之一。但早期低价获客正在收尾——入门价从 20 元/月涨至 Lite 版 118 元/月,并改为积分制,设置每 5 小时与每周的额度上限。

原因在于 Coding Agent 对 Token 消耗极大:一次长任务可能连续运行数小时,消耗数万至数十万 Token,推理算力供给有限使低价难以长期维持。产品层的布局因此更关键。ZCode 和 AutoClaw 旨在把项目上下文、工具配置和工作流程沉淀到智谱体系内,提高用户迁移成本。AI 研究员曾小健认为,真实工作环境、任务分布、可靠的验证机制和用户反馈,是比 GPU 和开源框架更难复制的资产——产品不仅能积累订阅用户,还能为下一轮后训练提供高质量「真题」。

从业务结构看,2025 年云端 MaaS 服务收入已占总营收 26.3%,截至 2026 年 3 月 MaaS 平台 ARR 约 17 亿元,过去一年增长约 60 倍;本地化部署仍占 73.7%。这说明「中国版 Anthropic」已有商业基础,但距离主要依靠标准化 API 与产品持续放大收入,仍有一段路要走。

GLM-5.3 证明智谱还能把模型做强,更难的考题是如何把这种能力持续转化为产品与生意。

信源