研究论文
xHC:突破残差流扩展瓶颈,把 Transformer 残差流推到 N=16
研究者提出 xHC,首次将超连接家族方法的残差流从 N≤4 扩展到 N=16,在 18B MoE 上较 mHC 平均提升…
2026.07.20 · 周一约 3 分钟阅读
残差流一直是 Transformer 扩展能力的关键通道,但传统设计在「更宽」这条轴线上长期受限。来自 arXiv 的最新论文《xHC: Expanded Hyper-Connections》提出了一套在残差流层面进行大规模扩展的新方案,首次让超连接(Hyper-Connections, HC)家族方法突破 N=4 的瓶颈,并配套显存优化策略 xHC-Flash,使大 N 残差流扩展在 LLM 预训练中真正可用。
研究背景:从 HC 到 mHC 的扩展困境
超连接(HC)将 Transformer 的单条残差流扩展为 N 条并行流,相当于在「宽度」和「深度」之外开辟了一条新的「记忆扩展」轴线。后续的 Manifold-Constrained HC(mHC)通过流形约束稳定了该方法在大模型上的训练。实验显示,残差流从 N=1 扩到 N=4 时收益最显著,但继续往上扩,性能增益迅速衰减、训练成本却急剧上升。
作者将这一「断点」归因于两点:
- 写回(write-back)信息不足以支撑更多并行流;
- 残差混合生成的计算成本随 N 呈三次方增长。
xHC 的核心设计
为同时解决上述两个瓶颈,论文提出 xHC(Expanded Hyper-Connections),主要包含两项改动:
- 时序特征增强:在写回阶段引入更丰富的时序特征,缓解多流扩展时的信息不足;
- 稀疏残差流架构:在 N=16 的总流数中,每次只更新 k=4 条流,但前向计算仍能稠密访问全部 16 条残差状态,兼顾表达力与训练效率。
实验结果与 scaling-law 分析
在 18B 和 28B 两种规模的 MoE 模型上,xHC 均取得稳定且明显的下游任务提升:
- 在 18B MoE 上,xHC 相对 mHC 的下游平均分提升 4.0 分;
- 相对 vanilla 基线,xHC 增加的训练 FLOPs 非常有限;
- scaling-law 实验显示,要达到同等 loss,vanilla 和 mHC 分别需要 xHC 1.50 倍和 1.19 倍的训练算力。
xHC-Flash:让大 N 训练真正可落地
N 增大后,残差状态本身会带来更高的显存读写压力。论文同步引入 xHC-Flash:
- 将单子层的显存流量从 73.5C 降至 40C;
- 与 mHC 在 N=4 时的 34C 基本处于同一量级;
- 同时保留完整 xHC 的精度增益。
这意味着大 N 残差流扩展不再只是理论设想,而可以在真实的大模型预训练中部署。
小结
xHC 把「残差流宽度」这条此前几乎被锁死的扩展轴重新打开:
- 方法层面:用时序增强 + 稀疏更新绕过 mHC 的两大瓶颈;
- 效果层面:在 18B/28B MoE 上稳定超越 mHC,训练成本反而更低;
- 工程层面:xHC-Flash 把显存开销压回到与 N=4 mHC 相当的水平。
论文与代码均已在 arXiv 与 GitHub 公开,为后续 LLM 架构层面的扩展提供了新的可复现基线。
