桃子桃子快讯
返回首页
研究论文

LLM 扩展定律:从 Kaplan 到 Chinchilla 的算力分配之争

梳理 LLM 扩展定律演进:自监督如何打破数据瓶颈,Kaplan 与 Chinchilla 的两次算力最优之争。

2026.07.30 · 周四4 分钟阅读

大语言模型的每一次训练,本质上都是一道算力分配题:从 OpenAI 2020 年的 Kaplan 路线,到 DeepMind 2022 年的 Chinchilla 路线,再到推理时代被忽视的「另一半方程」,扩展定律(Scaling Laws)几乎定义了现代 LLM 的设计哲学。Hacker News 上这篇文章系统梳理了这一脉络,把技术演进背后的数学与权衡一次性讲清。

自监督:数据瓶颈是如何被绕开的

深度学习长期被一条「偏差-方差」曲线束缚:模型太小欠拟合,盲目增大又会过拟合到训练数据的噪声上。多年来,提升模型能力的主要瓶颈并不是算力或架构,而是高质量标注数据的获取成本——人工标注既慢又贵,几乎无法线性扩展。

真正的转折点来自自监督:用文本本身作为标签,让模型预测下一个词。「The cat sat on the ___」中空白处的答案本就藏在训练语料里,无须任何标注员介入。书籍、代码、网页瞬间变成海量免费标注数据,标注瓶颈被绕开,而那条偏差-方差曲线右侧的「过拟合悬崖」也随之变得几乎触及不到。约束从此从数据切换到了算力。

6ND:每一次训练的成本账本

当数据不再是约束,算力就成了唯一的硬约束。一次完整训练的计算成本可以被压缩为一条简洁的公式:

C ≈ 6 × N × D

其中 N 是参数量,D 是以 token 计的数据集大小,常数 6 来自前向传播的 2 FLOP/参数/token 与反向传播的 4 FLOP/参数/token,研究者真正能调节的只有「在 N 与 D 之间如何分配预算」这一道选择题。

这道分配题在五年内被回答过三次,每次都催生出一代截然不同的模型。

Kaplan 路线与 Chinchilla 路线之争

2020 年 OpenAI 的 Kaplan 等人独立拟合 N 与 D 对损失的贡献,得出结论:每增加一单位算力,约 73% 应投向参数量,27% 应投向数据量。GPT-3(175B 参数 / 300B tokens)与 PaLM(540B / 780B)的 token-per-parameter 比例都不到 2——模型容量巨大却喂得不够饱,容易记住噪声而非学到结构。

两年后 DeepMind 的 Hoffmann 团队在 Chinchilla 工作中重做实验:横跨 400 余个模型、调优学习率、用 IsoFLOP 等高线替代单变量拟合,最终发现 N 与 D 的指数几乎相等。Chinchilla 以 70B 参数在 1.4T tokens 上训练,token-per-parameter 约 20:1,击败了更大的 GPT-3——不是因为更大,而是因为没被「饿着」。

Kapapan 路线的偏差更多来自方法论:拟合时排除了 embedding 参数,模型规模偏小,又采用了固定学习率 schedule,种种细节共同把结论推向「让模型更大」。Chinchilla 用更严谨的拟合纠正了这一倾斜,也由此重塑了整个前沿模型的训练预算分配方式。

推理成本:被忽视的另一半方程

Chinchilla 优化的是训练阶段的损失,却未回答部署后的真实账本:模型上线后可能被调用数十亿次。完整成本应当写作

C_total = C_train(N, D) + C_inf(N, Q)

其中 Q 是生命周期内的总查询数。训练是一次性投入,推理则随每次调用线性放大,而每个额外参数都会在每一次请求中被反复计价。生产环境中的模型常常位于这条曲线的左上角——训练阶段的「算力最优」未必是部署阶段的「总成本最优」。这也解释了为何近年来业界一面把训练侧继续推大,一面又把推理侧切向 MoE、蒸馏、更小激活参数等手段:在算力方程的两端同时寻找新的平衡点。

信源