Meta 开源 30B 本地 Agent 模型 Muse Glimmer
Meta MSL 团队开源约 300 亿参数的 Muse Glimmer,量化后可在 24GB 消费级显卡运行,支持图文…
Meta 旗下 MSL(Meta Superintelligence Labs)团队正式开源了一款面向本地部署的 Agent 模型 Muse Glimmer,总参数约 296 亿,其中视觉编码器约 18 亿,上下文长度超过 13 万 Token,支持文本与图像输入。该模型经量化后可在单块 24GB 消费级显卡上运行,主打规划、工具调用、自我检查与故障恢复等本地 Agent 能力。Meta 同期预告,更大尺寸的 Muse Spark 1.2 开放权重版本也将在不久后发布。
模型架构与训练方法
Muse Glimmer 的设计目标是在本地硬件内存与算力受限的条件下,平衡多种 Agent 功能需求。Meta 将训练过程分为三个阶段:
- 先从更大的 Muse Spark 中蒸馏能力;
- 再加入长上下文与 Agent 任务训练;
- 最后通过监督微调、在线蒸馏与强化学习,强化推理、编程与工具调用能力。
简而言之,模型先由大模型示范做事方法,再把这套能力压缩到更小的体积中。
两层压缩:量化与推测解码
为了让 30B 级模型跑进消费级硬件,Meta 在 Muse Glimmer 上做了两层压缩:
- 量化:完整精度需超过 55GB 显存,17GB 版本可直接装入 24GB 显卡。Meta 官方数据显示,该版本在 15 项常用评测上平均准确率损失约 1%,在面向 32GB 设备的版本上损失约 0.2%。
- DFlash 推测解码:模型先一次性提出一组候选 Token,再由主模型并行核对。在 RTX 5090 上,生成速度从 74.9 Token/s 提升至 233.4 Token/s,约 3.1 倍加速;在 M4 Max 与 M5 Max 上也分别获得 1.5 倍和 1.8 倍加速。
基准表现与定位
在多个考察 Agent 能力的基准测试上,Muse Glimmer 略优于 Gemma4-31B 和 Qwen3.6-27B。但 Meta 自己也明确指出,Muse Glimmer 整体能力弱于 Muse Spark,未达到前沿 AI 标准。在 OSWorld-Verified、SWE-Bench Verified 和 TerminalBench 2.1 等测试中,Qwen3.6-27B 仍领先。这意味着 Muse Glimmer 并非同尺寸全能冠军,定位更接近低门槛本地 Agent。
扎克伯格的「开源宣言」
Muse Glimmer 只是开场。扎克伯格在一篇文章中将 AI 行业分成了两条路线:一端是将超级智能集中于少数实验室、企业与政府手中,另一端则是将能力广泛分发给每个人,让个人 Agent 与用户目标对齐。Meta 明确选择了后者,并承诺:
- 继续开源部分模型,发布标准由独立董事会审批,保留安全评估;
- 提供 Meta 自己也无法查看的「完全隐私模式」;
- 让超级智能以免费或尽可能低的价格覆盖数十亿人。
此前,英伟达方面曾提出开源倡议,强调开放权重模型对 AI 生态健康的重要性,硅谷多数 AI 公司签名支持,仅 Anthropic 未签。Muse Glimmer 的发布被视为 Meta 在开源路线上的回归信号,前 Meta 知名研究员 Yann LeCun 也迅速在评论区表达力挺。
