桃子桃子快讯
←返回首页
研究论文

语言模型的「形状」是否该围绕智能体来设计?

作者探讨大模型输入输出形状的设计权衡,主张应围绕智能体 harness 而非 autoregressive 形式做架构调…

2026.09.27 · 周日约 4 分钟阅读

自 ChatGPT 发布以来,语言模型的输入 / 输出形状基本保持稳定,即 decoder-only Transformer 的 autoregressive 形式。前沿实验室倾向于延续这一已被验证的范式,因为押注替代方案的代价极高。于是,围绕智能体(agent)的工作几乎都聚焦于设计 harness 来适配模型的 autoregressive 形状,而非反过来改造模型本身。

什么是语言模型的「形状」

「形状」大致指模型的输入 / 输出结构。当下最通用的是 decoder-only Transformer,但若改变这一契约,会带来效率、长上下文等一系列权衡。作者认为,相对于为每个任务改造 harness,如果能调整模型本身的形状以适配 harness,长期摊销成本可能更低。

现代模型架构研究大多停留在「层内顺序与属性的细节优化」层面,整体仍是 decoder-only Transformer。原因有三:

  • decoder-only 模型极其强大且灵活;
  • 架构选择在规模化训练中价值数百万美元级别的算力差异;
  • 在任意文本上做 dense next-token prediction 是天然目标。

替代形状的探索与失望

作者曾对 State-Space Models(SSM)与 Mamba 等循环架构寄予厚望,但最终这些方案多以「与 attention 层交错堆叠」的混合形式出现,依然保留了 decoder-only 的整体形状。所谓「混合」也仅是纵向层级上的 attention 与 SSM 交替,而非在并行残差流上各自发挥作用。这些层相对于 Transformer 具有不同特性,理应在 harness 中得到更多利用——而 decoder-only Transformer 默认的「任意文本 → 任意文本」形状未必是最优解。

Jev 与受限输出空间的示例

本月发布的 Jev(Typesafe AI, 2026)是一个典型示例:其输出空间被显式约束在 [0, 1] 区间内。这使得 Jev 在采样时可采用 prefill-only 模式,对特定类型的问题响应极快。围绕这一设计,作者认为存在一些尚待验证的实用性问题,但 Jev 揭示了围绕语言模型形状进行替代权衡的可能性:在某些场景下,用户可能更倾向于选用 Jev 而非前沿大模型。

Jev 还提出了一种新目标函数——Reinforcement Learning for Calibrated Decisions(RLCD,撰写时仍未公开细节)。作者推测,针对其他输入 / 输出形状,同样需要设计修改后的目标函数,才能真正优化所需行为。

智能体轨迹下的形状反思

作者的核心观点是:decoder-only Transformer 并不是处理智能体轨迹(agent trajectory)的天然或终极形态,这也解释了为何会出现上下文压缩(compaction)等技巧。LLM 时代的智能体多基于 ReAct 变体,每一轮都基于历史轨迹 H<t 与新观察 o_t 生成动作 a_t。

这种形式带来两个广为人知的问题:

  • 模型上下文窗口有限,历史必须被压缩;
  • 用户对近期观察与远期历史的关注度并不相等,需要在不密集关注每个 token 的前提下条件化历史。

智能体通常需要密集关注近期观察,并稀疏地从远期历史中检索。但线性注意力或固定状态方法在准确检索远期信息上存在困难,因此至少保留一个全局 dense attention 层几乎是标配。作者认为,若能设计更适配智能体轨迹特性的模型形状——例如对近期观察做密集处理、对远期历史做稀疏检索——可能会比纯粹堆 scaling 更具原则性,也更需要创造力。

信源