桃子桃子快讯
返回首页
研究论文

Dual-Flow Transformer:将预填充与解码计算解耦的新架构

论文提出 Dual-Flow Transformer,通过主辅双流设计把预填充与解码阶段的计算分开,降低大模型累积推理成…

2026.08.15 · 周六3 分钟阅读

随着大语言模型被大规模部署,一次性训练成本之外,累积推理成本正在成为越来越关键的支出项。预填充(prefill)阶段并行度高、通常是计算密集型;而自回归解码(decode)阶段串行执行,普遍受限于显存带宽。传统通过加宽或加深模型提升能力的方式,会让两个阶段的成本同步上涨,并未区分对待。arXiv 上最新发布的 Dual-Flow Transformer 论文,正是围绕这一痛点展开。

问题:两阶段硬件压力不同,却常被一并处理

论文开篇指出,预填充与解码对硬件资源的压力方向不同:前者是并行、计算受限,后者是串行、带宽受限。然而,常规的宽度或深度扩展会同时推高两项开销——每新增一层都会在两个阶段都被评估。这意味着传统架构把「处理 prompt」与「预测续写」当成一个整体来对待,缺少针对续写任务的额外计算通道。

论文想回答的核心问题是:能否为续写预测额外分配可学习的计算资源,同时保持 prompt 主路径不变、不污染主 KV 缓存?

方案:主辅双流 + 共享权重与缓存

Dual-Flow Transformer 的设计由两条流组成:

  • 主流(primary flow):完整的因果语言模型,负责处理 prompt 并写入 KV 缓存。
  • 辅流(auxiliary flow):在 prompt 处理阶段被省略,仅从 prompt 末尾位置开始激活,专门为续写预测增加计算,但不写持久化状态,也不影响主流的输出。

两条流共享主要的注意力、MLP 与输出矩阵,仅使用独立的 token embedding 与轻量级耦合。这意味着辅流可以「挂载」在现有模型之上,复用主流已加载的权重与缓存键值,为分组执行(grouped execution)带来复用机会。

验证结果与 MoE 场景

在等 token 量比较中,Dual-Flow 在不同架构与数据配置下都取得了更低的验证损失。在 MoE 模型上,这一分离进一步带来一项关键收益:主流与辅流的专家 fan-out 成为相互独立的控制变量,分别用于调节 prompt 成本、续写成本与预测质量。

论文重点研究了两类实验设定:

  • 在固定预填充专家算力下增加解码算力;
  • 在固定解码专家预算下,将其重新分配到主流与辅流之间。

这些实验揭示了一个 预填充-解码-质量权衡(prefill-decode-quality trade-off),并展示了阶段特定专家分配(phase-specific expert allocation)的潜力。

意义:一种面向「续写阶段」的精细化思路

Dual-Flow 的核心思想并非追求更大的模型,而是承认推理两阶段的硬件特性差异,并允许在续写阶段投入额外但不污染主路径的计算资源。对于那些部署规模大、解码 token 量远高于 prompt 长度的应用(如长对话、代码生成、文档续写)来说,这是一种具备现实吸引力的优化方向。该论文的价值更多在于提出一种结构化的可调维度,而非立刻给出可落地的工业级方案,后续若能在更大规模模型与真实推理栈中验证,将更具说服力。

信源