桃子桃子快讯
返回首页
研究论文

用 Harness 让大模型学会组合泛化

研究者主张用包裹模型的 harness 程序承担高层归纳偏置,并以递归语言模型在短任务上训练,实现 8–32 倍长度泛化…

2026.07.28 · 周二4 分钟阅读

围绕大语言模型的「组合泛化」能力,一篇新文章提出一种与传统 post‑training 思路截然不同的路径:与其不断扩大训练环境和训练时长,不如把任务结构化的责任交给包裹神经网络的「harness」。作者以递归语言模型(RLM)作为 harness 的具体实例,在 Qwen3‑30B‑A3B‑Instruct‑2507 上验证了该思路,并观察到长度泛化与跨域迁移均显著优于直接训练 Transformer。

现有 post‑training 的瓶颈

文章开篇指出,现代 post‑training 已退化为一种「暴力式」范式:不断扩大训练环境、不断延长训练 horizon。但前沿 Transformer 在组合泛化上仍然薄弱——它们难以把已学会的子技能重新组合,去解决训练中未见过的任务。这意味着只要一个新领域出现,就需要为其重新投入训练数据,规模化回报正在递减。

训练数据之外,过去几年业界主要靠「脚手架」让模型处理更复杂的任务,先有 chain‑of‑thought 推理,再有 tool use。然而在所有这些改进中,泛化本身始终被交给底层神经网络及其 2017 年提出的 token 级归纳偏置,缺乏更高层次的归纳结构。

Harness:把归纳偏置放到更高的层

文章的核心论点是:更高层、更具结构性的归纳偏置,应当由 harness 承担。Harness 是夹在外部世界与神经网络之间的程序,负责:

  • 决定如何把当前环境状态(可能任意长、任意复杂)编码成 LLM 的输入;
  • 决定如何根据模型输出确定下一步动作。

一个好的 harness,应当把每一次对底层 Transformer 的调用塑造成「局部 in‑distribution」的提示,使每一步输入都贴近模型训练数据的分布。这样,许多看似需要 post‑training 突破的问题,往往可以被化归为现有语言模型已具备的平凡能力。

RLM:用递归子调用实现长度与跨域泛化

为验证上述观点,作者设计了 Recursive Language Model(RLM):让模型把上下文外置(offload),并把执行过程延后到程序化分解和递归子调用中。他们用强化学习在 Qwen3‑30B‑A3B‑Instruct‑2507 上训练 RLM,并与加 YaRN 的基线 Transformer 进行对比。

关键结果如下:

  • 长度泛化:仅在短任务上训练,模型就能泛化到 8–32 倍长度的未见任务;在相同的训练收益下,评估收益约为直接训练 Transformer 的 10 倍。
  • 跨域迁移:在一组领域训练后,可在另一组共享分解策略的领域上获得远好于 vanilla Transformer 的迁移效果。
  • 策略演化:在部分长度泛化实验中,RLM 起初只找到对短任务有效的方案,但训练过程中会自行发现更通用的分解策略,使评估收益反过来超过训练收益。

为什么 harness 能带来泛化

文章给出了理论层面的解释:RLM harness 在任务之间诱导出一种「等价关系」——对根 LM 的主上下文而言,结构相似的任务看起来拥有几乎相同的 token 级轨迹。作者用 BrowseComp‑Plus 与 OOLONG 两个任务举例说明:尽管表面不同,但通过把领域相关查询下沉到子调用、用 REPL 变量在调用之间传递信息,根 LM 的上下文窗口内呈现的轨迹可以是同构的。在数学上,这等价于在全部轨迹上诱导出一个商集 Hi/Q,把相似任务归约到同一 token 轨迹。

这一结果的意义在于:和调整模型架构、改进训练配方一样,精心设计的 harness 同样能降低数据与 rollout 的成本,并扩大 post‑training 可覆盖的任务集合。换言之,要把模型从「见多识广但不会举一反三」推向真正的组合泛化,关键未必在于把模型本身训得更大,而在于如何包裹它。

信源