开源
Meta 发布 MobileMoE 系列:面向手机端侧的亚十亿参数 MoE 模型
Meta 开源 MobileMoE 系列端侧 MoE 大模型,提供 0.3B/0.5B/0.9B 三档激活参数,INT4…
2026.08.25 · 周二约 3 分钟阅读
Meta 近日在 Hugging Face 上线了 MobileMoE 系列模型,主打面向移动设备的端侧部署。该系列采用 Mixture-of-Experts(MoE)架构,激活参数控制在亚十亿(sub-billion)量级,同时通过 INT4 量化将权重体积压缩到 3GB 以内,使其能够装入常见的移动设备 DRAM 容量。
系列构成与三档规模
MobileMoE 共推出 S、M、L 三档规模,对应激活参数为 0.3B / 0.5B / 0.9B,总参数量分别为 1.3B / 2.8B / 5.3B。每个规模均提供三种变体:
- Base:完成预训练与中训练(mid-training)的基础模型。
- SFT:在 Base 基础上做监督微调的版本。
- QAT:采用量化感知训练(Quantization-Aware Training)的版本,进一步面向端侧部署优化。
此次被提交到 LocalLLaMA 社区的具体仓库为 MobileMoE-L-Base,即 0.9B 激活参数的基础模型。
L 档关键架构细节
以 MobileMoE-L 为例,模型核心配置如下:
- 激活参数:922M;总参数:5.3B
- 层数:32,模型维度:1280
- 注意力头:20 个,KV 头:4 个(GQA),头维度:64
- 路由专家:60 个细粒度专家,每个 FFN 隐层维度 640
- 每 token 激活专家:4 个(top-k sigmoid 路由 + 归一化)
- 共享专家:1 个,始终开启,FFN 隐层维度 2560
- 词表大小:128,256
- 其他特性:QK-Norm、输入输出 embedding 绑定、RoPE(θ = 500,000)
- 上下文长度:8,192 tokens
- 精度:BF16
- 支持模态:纯文本输入输出,英文
- 训练流程:预训练 → 中训练
定位与许可
MobileMoE 主打「在端侧 LLM 的质量–效率帕累托前沿上推进」,目标是在手机等移动设备的内存与算力约束下,保留 MoE 架构带来的容量优势,同时压低激活开销。开发者为 Meta,许可证为 FAIR Non-Commercial(仅限非商用),意味着该系列更适合学术研究和个人实验,商业落地需另行评估授权。
(说明:原始资料中标注的发布日期为「Aug 2026」,结合该模型在社区中已出现下载与讨论的时间线,该时间戳疑似排版或录入错误,实际公开发布应为 2024–2025 年间。)
