研究论文
MoE 分层敏感性研究:晚层可承受激进专家掩码
对 Qwen3.6-35B-A3B 40 层 MoE 做幅度掩码实验,发现晚层对低权重专家裁剪更鲁棒,为深度感知压缩方案…
2026.08.17 · 周一约 3 分钟阅读
研究背景与对象
arXiv 上的一项研究对 Mixture-of-Experts(MoE)架构做了系统化的层敏感性分析,重点回答"MoE 模型各层对专家裁剪的容忍度是否存在差异"这一问题。研究对象是 Qwen3.6-35B-A3B 模型,其 MoE 配置为每层 256 个专家、token 激活 top-8 路由,共 40 个 MoE 层。评测任务选用了 XLCoST 跨语言代码翻译基准,实验在 3 台 H100 GPU 上分 100、300、500 三个 prompt 规模开展。
核心发现:深度依赖的层敏感性
研究的最核心结论是,MoE 模型的层敏感性呈强深度依赖特征:
- 浅层(0-9)与中层(10-29)对专家掩码高度脆弱,一旦削减低幅度专家,翻译质量显著下降;
- 晚层(30-39)、尤其是最末五层(35-39),对激进掩码表现出很强的鲁棒性,输出质量几乎不受影响。
这一发现意味着,MoE 压缩策略不应在所有层"一刀切",而应把削减预算集中投放到晚层。
量化结果对比
研究给出了清晰的数字对比,验证了上述结论:
- 300 prompt 规模下,对所有层做 30% 的扁平掩码,仅保留 150/300 的 Good+Similar 输出;
- 改为聚焦晚层的策略后,输出保留数提升至 249-255/300,同时掩码的专家数量达到 640-1,145 个;
- 在 500 prompt 的留出验证切片上,最窄策略(layers 35-39 @ 50%)在所有候选方案中取得最佳的质量-掩码权衡:以仅掩码 10,240 个专家中的 640 个为代价,保留 419/500 的 Good+Similar 输出。
路由宽度缩减的额外探索
研究还顺带考察了将 top-k 路由宽度从 8 降到 6 的效果。在 100 prompt 的探针测试中,这一调整带来了显著的端到端时延下降,同时未观察到 Good+Similar 损失。但需要指出的是,路由缩减与激进专家掩码目前尚无法干净地组合使用,这仍是后续工作需要解决的问题。
意义与展望
该研究为深度感知的 MoE 专家掩码提供了实证基础,并指向三个值得跟进的方向:物理层面的权重手术、基于激活的专家打分,以及训练阶段的恢复策略。对于正在探索 MoE 模型部署与压缩成本优化的从业者而言,"晚层更鲁棒"这一经验法则提供了一个可直接落地的先验。
