W2SPO:用 8 token 弱分支引导大模型推理训练提速 3.55 倍
arXiv 新论文提出 W2SPO 弱到强 off-policy RL 方法,通过插入约 8 token 的弱模型片段扩…
arXiv 最新论文《It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches》提出了一种名为 W2SPO 的 off-policy 强化学习方法,专门用于提升大语言模型的推理能力。该方法针对当前 RLVR 范式中普遍存在的「support limited」瓶颈——目标模型在难题上生成的样本语义高度冗余,容易陷入同一错误推理模式,导致用于策略更新的奖励对比信号不足。
方法核心:弱模型引导的分支注入
W2SPO 采用「弱到强」学习范式,让一个更弱但计算成本更低的辅助模型参与目标模型的探索过程。具体做法是:在目标模型生成推理轨迹的中间位置,注入一段来自弱模型的辅助分支(auxiliary segment),长度通常仅约 8 个 token,随后目标模型从被打断的状态继续完成推理路径。策略梯度更新被限制在这些短插入片段上,基于最终的 verifiable reward 进行优化,从而避免对整条轨迹的大规模回传开销。
实验结果与加速效果
论文在 4B 规模的模型上以数学推理基准进行评估。结果显示:
- 在同等采样预算下,W2SPO 将 Pass@1 从 vanilla GRPO 的 62.3% 提升至 64.2%;
- 训练速度达到 3.55 倍加速;
- 在所对比的后训练基线中取得最优表现。
作者认为,弱辅助分支的价值在于扩展了局部探索支持(local exploration support),使目标策略能跳出重复的「错误推理盆地」,从而在较少的额外计算下获得更强的推理能力。
意义与局限
W2SPO 提供了一条以极小代价(仅 8 token 量级的注入)撬动 RLVR 训练效率的路径,对大规模推理模型的后训练成本控制具有参考价值。不过目前实验仅在 4B 规模模型与数学推理任务上验证,更大模型、更多任务类型下的泛化效果尚待进一步检验。该工作目前以 arXiv 预印本形式发布(编号 2607.16205v1),尚未经过同行评审。
