智谱 GLM-5.3 发布:参数不变,以一个月的后训练换取提升
智谱发布 GLM-5.3,参数与 GLM-5.2 完全一致,主打一个月的长程环境与 RL 后训练扩展。
智谱(Z.ai)近日公开了 GLM-5.3 模型,并以一篇长文阐述其对「scaling law」的最新理解。与多数以参数规模为卖点的发布不同,GLM-5.3 在基础架构、总参数与激活参数上与上一代 GLM-5.2 保持一致,主要差异来自一个月的长程环境训练与强化学习后训练。官方称「提升不是边际的」,但未公开具体基准数据。
关于参数量的反思
文章回顾了过去几年 scaling law 的演进。Kaplan 等人 2020 年的拟合结果曾让行业相信参数应比数据增长更快(约 2.7:1),GPT-3、Gopher、MT-NLG 都是这一思路下的产物。Hoffmann 等人 2022 年基于 400 个模型的实验则给出了 compute-optimal 的结论,即参数与数据应大致按 1:1 增长,每个参数对应约 20 个 token。此后 Llama-2-7B、Gemma-2-9B 等则通过「刻意过训」(分别约 290、889 token/参数)将优化目标从训练 compute 转向推理总成本。
文章认为,Chinchilla 之后 scaling 的「目标」仍在移动:模型一天被调用数十亿次,推理成本主导生命周期,纯粹的训练 compute 最优已不再是唯一标准。
MoE 与任务相关的最优比
进入 MoE 时代后,总参数与激活参数需要分开看待:
- 总参数大致决定模型能「记住」多少知识与长尾事实;
- 激活参数与有效深度则决定模型能「想多远」,即在多长的因果链中保持推理连贯。
作者引用 Roberts 等人 2025 年的研究指出,最优 token-per-parameter 并非单一数字,而是任务相关:记忆类任务偏向更多参数,推理类任务则偏向更多数据。在固定 TPP 的前提下,MoE 中继续推高总参数反而会损害推理,而增加激活专家数则稳定有助于推理。
文章以漏洞发现为例说明:找到漏洞不是检索问题,需要保持一条二十步的推理链不断裂,这一能力并不由总参数决定。
GLM-5.3 实验:后训练还有余量
基于上述判断,智谱把 GLM-5.3 设计成一次「控制变量」的实验:基础模型、架构、总参数与激活参数全部与 GLM-5.2 一致,仅在长程环境与 RL 后训练上投入约一个月的额外算力。作者明确表示选择后训练这一维度,是因为「它还有最多的余量」,并非认为其他维度已到尽头——基础模型规模、预训练数据、单次前向 compute 都被明确列入后续考虑范围。
文章结尾强调:scaling 的多个旋钮不必同时转动,下一个值得转动的旋钮通常不是上一个转动过的那个。智谱称后续可能尝试 mid-training、预训练乃至更激进的扩展方向。
信息缺口
尽管官方将 GLM-5.3 定位为一次方法论验证,目前公开信息中缺少以下关键内容:
- 与 GLM-5.2 的具体 benchmark 对比;
- 长程环境训练与 RL 的具体配比与算法细节;
- 部署形态、上下文长度、推理成本变化;
- 与同期主流模型的横向对比。
换言之,文章提供了清晰的方法论叙述与 scaling law 视角,但「提升不是边际的」这一核心论断仍需更多数据支撑。
