桃子桃子快讯
返回首页
研究论文

xHC:突破残差流扩展瓶颈,把 Transformer 残差流推到 N=16

研究者提出 xHC,首次将超连接家族方法的残差流从 N≤4 扩展到 N=16,在 18B MoE 上较 mHC 平均提升…

2026.07.20 · 周一3 分钟阅读

残差流一直是 Transformer 扩展能力的关键通道,但传统设计在「更宽」这条轴线上长期受限。来自 arXiv 的最新论文《xHC: Expanded Hyper-Connections》提出了一套在残差流层面进行大规模扩展的新方案,首次让超连接(Hyper-Connections, HC)家族方法突破 N=4 的瓶颈,并配套显存优化策略 xHC-Flash,使大 N 残差流扩展在 LLM 预训练中真正可用。

研究背景:从 HC 到 mHC 的扩展困境

超连接(HC)将 Transformer 的单条残差流扩展为 N 条并行流,相当于在「宽度」和「深度」之外开辟了一条新的「记忆扩展」轴线。后续的 Manifold-Constrained HC(mHC)通过流形约束稳定了该方法在大模型上的训练。实验显示,残差流从 N=1 扩到 N=4 时收益最显著,但继续往上扩,性能增益迅速衰减、训练成本却急剧上升。

作者将这一「断点」归因于两点:

  • 写回(write-back)信息不足以支撑更多并行流;
  • 残差混合生成的计算成本随 N 呈三次方增长。

xHC 的核心设计

为同时解决上述两个瓶颈,论文提出 xHC(Expanded Hyper-Connections),主要包含两项改动:

  • 时序特征增强:在写回阶段引入更丰富的时序特征,缓解多流扩展时的信息不足;
  • 稀疏残差流架构:在 N=16 的总流数中,每次只更新 k=4 条流,但前向计算仍能稠密访问全部 16 条残差状态,兼顾表达力与训练效率。

实验结果与 scaling-law 分析

在 18B 和 28B 两种规模的 MoE 模型上,xHC 均取得稳定且明显的下游任务提升:

  • 在 18B MoE 上,xHC 相对 mHC 的下游平均分提升 4.0 分
  • 相对 vanilla 基线,xHC 增加的训练 FLOPs 非常有限;
  • scaling-law 实验显示,要达到同等 loss,vanilla 和 mHC 分别需要 xHC 1.50 倍1.19 倍的训练算力。

xHC-Flash:让大 N 训练真正可落地

N 增大后,残差状态本身会带来更高的显存读写压力。论文同步引入 xHC-Flash:

  • 将单子层的显存流量从 73.5C 降至 40C
  • 与 mHC 在 N=4 时的 34C 基本处于同一量级;
  • 同时保留完整 xHC 的精度增益。

这意味着大 N 残差流扩展不再只是理论设想,而可以在真实的大模型预训练中部署。

小结

xHC 把「残差流宽度」这条此前几乎被锁死的扩展轴重新打开:

  • 方法层面:用时序增强 + 稀疏更新绕过 mHC 的两大瓶颈;
  • 效果层面:在 18B/28B MoE 上稳定超越 mHC,训练成本反而更低;
  • 工程层面:xHC-Flash 把显存开销压回到与 N=4 mHC 相当的水平。

论文与代码均已在 arXiv 与 GitHub 公开,为后续 LLM 架构层面的扩展提供了新的可复现基线。

信源