AMD 发布完全开源 MoE 模型 Instella-MoE:16B 总参 / 2.8B 激活
AMD 推出 16B 总参数、2.8B 激活参数的完全开源 MoE 模型 Instella-MoE,全程在 MI300X…
AMD 近日推出完全开源的混合专家(MoE)大语言模型 Instella-MoE,总参数量为 160 亿、每 token 激活 28 亿参数。该模型在 AMD 自家 Instinct MI300X 与 MI325X GPU 上基于 ROCm 软件栈从零训练,是 AMD「在自有硬件上训练先进大模型」路线的重要里程碑。AMD 同时开源了从预训练到后训练全流程的模型权重、训练配置、数据配比与代码,是目前开源社区中释放训练全链路资源最完整的工作之一。
模型规模与核心特性
Instella-MoE 采用仅解码器架构,共 27 层,隐藏维度 2048,总参数量 16B,每个 token 激活约 2.8B 参数。MoE 层采用「共享专家 + 路由专家」的混合设计:每 token 额外经过 2 个共享专家,并从 64 个候选路由专家中选取 6 个。预训练与中训练阶段还引入了多 token 预测(MTP)目标,用以提升训练效率与表征能力。
架构与系统级创新
模型引入两项关键创新:
- Gated Multi-head Latent Attention(Gated MLA):在标准多头潜在注意力(MLA)的基础上,为每层 MLA 输出增加一个轻量级、可学习的输出门控。该门控由输入条件生成,乘性作用于 MLA 输出后再做输出投影,使模型能够按 token 选择性地衰减低价值注意力响应,以较低代价提升表达能力。
- FarSkip-Collective 连通模式:改造 MoE 层与注意力层之间的标准残差连接,将「过时但部分可用」的激活直接送入下一层 MoE/注意力层,从而在专家并行训练与推理中更好地重叠通信与计算,减少通信气泡并保持模型精度。官方称该设计在预训练阶段带来约 12% 的速度提升。
多阶段训练管线
AMD 开源了从预训练到强化学习共 6 个阶段的检查点,覆盖完整训练链路:
- Instella-MoE-16B-A3B-Pretrain:在多样化大规模语料上从零训练的 MoE 基座模型。
- Instella-MoE-16B-A3B-Midtrain:在高质量数据配比上继续训练,进一步打磨关键能力。
- Instella-MoE-16B-A3B-Base:长上下文扩展阶段,作为最终基座检查点。
- Instella-MoE-16B-A3B-SFT:在基座上做有监督微调(SFT),引入指令遵循与思维链推理能力。
- Instella-MoE-16B-A3B-DPO:通过直接偏好优化(DPO)使用对比偏好数据提升表现。
- Instella-MoE-16B-A3B-Think:在 RL 阶段进一步强化指令遵循与整体回答质量,作为最终「思考版」检查点。
训练与软件栈
整个训练链路基于两个开源框架构建:用于通用训练的 Primus,以及用于强化学习阶段的 Miles。AMD 表示,这套 ROCm 软件栈在 MoE 大模型训练与推理场景下已具备可扩展性与效率,覆盖从预训练到后训练的完整流程。其意义在于为「非 NVIDIA 硬件 + 开源软件栈」训练先进 MoE 大模型提供了一份可复现的工程范本。
开源与社区意义
AMD 一并释放了所有训练框架、数据配比、中间检查点与推理代码,使社区能够复现结果并在其上继续迭代。在主流大模型以闭源或仅开源权重为主的背景下,Instella-MoE 提供了包括数据与训练配置在内的「全栈」开源,进一步丰富了 10–20B 规模完全开源模型的选项,对关注 AMD 硬件路线与开源大模型研究的开发者与研究者具有较高的参考价值。
