桃子桃子快讯
返回首页
模型发布

智谱联创撰文谈 Scaling Law:GLM-5.3 押注后训练扩展

智谱联合创始人发文回顾 Scaling Law 演进,并宣布 GLM-5.3 以同架构、同参数量为前提,将缩放重心转向长…

2026.08.19 · 周三3 分钟阅读

智谱(Z.ai)联合创始人近日撰文,围绕大模型缩放规律(Scaling Law)展开系统讨论,并同步披露了 GLM-5.3 的核心思路:在保持基础架构与参数量不变的前提下,将扩展的重心从预训练参数转移到后训练阶段。文章明确指出,「缩放不止参数一个旋钮」,下一阶段最具潜力的方向是长程环境与强化学习。

从 Kaplan 到 Chinchilla:缩放认知的两次修正

2020 年 Kaplan 等人的拟合结果让业界普遍以约 2.7:1 的比例优先放大参数量,GPT-3、Gopher、MT-NLG 等模型均遵循了这一思路。但 Hoffmann 等人 2022 年在约 400 个模型上重新实验后指出,训练计算最优的参数量与数据量比例约为「每参数 20 token」;在足够算力下,两者应同比例增长,而非持续拉开。早期拟合的误差随计算量逐级放大,使那一代最大模型在配置上最为失衡——万亿参数曾被视为必经之路,事后看来更像整个领域共同走过、随后又集体回退的一段弯路。

Chinchilla 也并非终点:其优化对象是「训练一次、评估一次」的模型,而今天的大模型每天被调用数十亿次,推理成本远超训练成本。将推理纳入目标函数后,最优解会向更小但训练更充分的模型偏移——即所谓「有意为之的过度训练」。Llama-2-7B(每参数约 290 token)与 Gemma-2-9B(约 889 token)正是这一思路的实践代表。

MoE 让缩放目标再次位移

在混合专家(MoE)架构下,必须区分两个量:总参数量大致决定模型能「记住」多少——知识、事实、长尾信息;激活参数量与有效深度则决定模型能「想多远」——一条因果链能在多少步推理中保持连贯。密集模型上适用的 20:1 比例并不能直接迁移到 MoE。Roberts 等人 2025 年的研究进一步指出,「每参数 token 数」本身并非单一最优值,任务不同则最优值不同:记忆类任务偏向更多参数,推理类任务偏向更多数据。后续 MoE 研究也观察到,在固定 TPP 的情况下,推高总参数量反而会损害推理能力,而增加激活专家数则能稳定带来推理提升。

GLM-5.3:一次押注后训练旋钮的受控实验

这一认知直接影响产品方向。文章指出,找到一个漏洞并非检索问题,不能仅靠记住更多 CVE 来解决,而是要能在不丢失主线的情况下完成二十步以上的推理链;这种能力并不寄居于总参数量。

基于此,GLM-5.3 被定位为一次受控实验:在与 GLM-5.2 相同的基础模型、相同架构、相同总参数量与激活参数量的前提下,团队投入一个月时间扩展长程环境与强化学习后训练。作者明确表示「收益并非边际性的」,但文中未给出具体 benchmark 数字。文章同时强调,基础模型规模、预训练数据、单次前向传播的算力消耗这三项仍在议程上,后续将逐一回到这些方向。本轮实验的核心结论是:缩放的不同旋钮不必同时拧动,而下一个值得拧的旋钮,往往不是上一个值得拧的。

信源