ToMoE:通过动态结构剪枝将稠密 LLM 转为 MoE 架构
研究提出 ToMoE 方法,在不永久删除参数的前提下将稠密模型的 MLP 层转为 MoE,兼顾参数效率与性能。
一项发表于 arXiv 并已被 ICML 接收的研究提出名为 ToMoE 的方法,旨在将稠密大语言模型(LLM)转换为混合专家(Mixture-of-Experts, MoE)架构,从而在不永久删除模型参数的前提下,降低推理时的计算与显存开销。
研究背景
大语言模型在各类复杂任务上表现突出,但庞大的参数量带来了高额的计算与显存成本,使其在资源受限设备上的部署以及高效率推理服务都面临挑战。以往的模型压缩方案往往通过永久删除被认为不重要的结构来减小模型规模,但这种做法会显著降低模型能力,因为被删除的参数无法在后续任务中被重新激活。
ToMoE 的核心思路
ToMoE 试图跳出「先删后减」的思路,强调「减而不删」。其核心做法是引入一种可微分(differentiable)的动态剪枝方法,将稠密模型的 MLP 层改造为 MoE 结构,使模型在运行时始终保持固定数量的激活参数,但所有原始参数仍然保留在网络中,可以根据输入动态路由。
实验表现与适用模型
研究者指出,ToMoE 即便在不进行额外微调(fine-tuning)的情况下,也能在多种主流模型族上稳定优于以往的结构剪枝方法。论文中明确验证的模型包括:
- Phi-2
- LLaMA-2
- LLaMA-3
- Qwen-2.5
这一结果说明该方法对不同规模、不同家族的稠密模型具有一定通用性。
资源与后续
论文已公开在 arXiv(编号 2501.15316),并被 ICML 接收为 2026 海报论文,同时在 OpenReview 上开放评审。配套代码已在 GitHub 开源,地址为 https://github.com/gaosh/ToMoE,社区中也已有用户提出希望将该方法应用于 Qwen3.8-27B 等更新的稠密模型上。整体而言,ToMoE 为「在保留原始参数的前提下获得 MoE 推理效率」提供了一条新的可探索路径。
