LLM 强化学习为何有效?一篇推测性分析
博客文章探讨为何 RL 在 LLM 训练中看似信息低效,实证却高度样本高效,并尝试给出理论解释。
近日一篇带有「Epistemic Status: Obviously speculative」标注的博客文章,针对大语言模型(LLM)训练中强化学习(RL)的「信息论悖论」展开了系统讨论。文章指出,从信息论角度看,LLM 的 RL 训练似乎极度低效,但实证表现却恰恰相反,作者尝试给出自己的假说以调和这一矛盾。
信息论层面的「低效」表象
文章首先梳理了 Ord、Dwarkesh 等人提出的经典论证。预训练(含 SFT)对每个 token 计算损失,每个 token 都提供信息;而用于 LLM 的策略梯度式 RL 往往只在一次长 rollout 末尾给出单个标量奖励(常常是 0/1 的二值成功信号),单次 rollout 长度可达数十万 token。这意味着:
- 每样本获得的信息量仅为 1/rollout_length 个 bit,相比预训练呈数量级差距;
- rollout 需要执行解码,远比 prefill 更昂贵(受限于长序列下 transformer 推理的内存带宽);
- 奖励函数本身往往粗糙,常见的二值成败信号甚至会因为「忘了写 \boxed」或「调用错工具」等小错而抹杀整次 rollout 的贡献。
按此推论,RL 似乎注定只能带来极小的信息增益,且只能激发基座模型已有的能力。
实证的「高效」反例
然而经验事实与上述理论判断几乎完全相反。文章列举了若干令人困惑的实证现象:
- 在数百到数千步内,RL 即可将模型从「勉强能做」提升到「近乎完美」;
- 强收益有时仅需十步左右即可观察到,这在预训练中几乎不可能实现;
- 与过去十年独立 RL 研究积累的复杂技术栈(价值函数、MCTS 策略搜索、回放缓冲、潜在空间内的 model-based rollout 等)相比,LLM 中使用的 RL 方法相当原始,仅是策略梯度的轻微变体;
- 在 LLM 场景下表现良好的几乎都是 GRPO 类同策略方法;显式价值函数、回放缓冲等「经典」技巧反而效果不佳。
更值得注意的是,迭代式 self-SFT(用模型自身成功轨迹继续做监督训练)在信息密度上与预训练等价,理论上理应胜过 RL,但实践中其效果远不如策略梯度 RL。
对同策略性的极端敏感
文章还指出 LLM 的 RL 训练对「陈旧度」和训练端/推理端的数值一致性异常敏感:
- 推理栈中过去常被忽略的微小数值差异,会突然决定训练是否稳定甚至崩溃;
- 适度的 off-policy 偏移即会导致性能平台期或不稳定;
- 这与 Atari 时代经典 RL 的「狂野西部」式宽松环境形成鲜明对比——回放缓冲中混入任意时间的轨迹也无关紧要,分布式 RL 时代也没人刻意对齐 trainer 与 rollouter 的数值精度。
重新审视 SNR 与偏差—方差权衡
文章认为既有的「每 token 信息量」框架低估了 RL 的实际效能,并预告将分两步给出自己的解释:
- 先针对信息论差距,给出能解释 RL 为何对 LLM 高效的假说;
- 再提出一个关于训练各阶段 SNR(信噪比)与偏差—方差权衡的更广义理论,用以说明 LLM RL 为何表现出与传统 RL 截然不同的特性。
由于原文在论证具体分解时截断,读者若希望了解作者对 Ord-Dwarkesh 分解的回应以及 SNR 框架的完整数学表达,需参阅原始文章。整体而言,本文是一篇典型的个人推测性写作,明确标注「speculative and maybe obvious」,并未给出定量 benchmark 或可复现实验,更接近思想实验层面的开放讨论,而非可立即落地的研究结论。
