Meta 开放 30B 本地 Agent 模型 Muse Glimmer,消费级显卡可跑
Meta 推出 300 亿参数的本地 Agent 模型 Muse Glimmer,Apache 2.0 开放权重,量化后…
Meta 近日推出 300 亿参数本地 Agent 模型 Muse Glimmer,并以 Apache 2.0 协议开放权重。这是 Meta 成立超级智能实验室(MSL)以来首次开放模型权重,定位为可在消费级设备上离线运行的基础 Agent 模型。CEO 马克·扎克伯格同步发长文阐述 Meta 的超级智能路线,呼吁减少对开源 AI 模型的限制,并预告旗舰模型 Muse Spark 1.2 的权重将很快开放。前首席 AI 科学家、图灵奖得主杨立昆(Yann LeCun)随后在该长文下公开回应,称「开放权重是很棒的一步」。
模型定位与硬件门槛
Muse Glimmer 被定位为本地个人 Agent 的基础模型,可用于整理文件、管理日程、起草消息、本地编程与函数调用等场景。其核心特性包括:
- 参数规模:300 亿参数稠密模型;
- 量化体积:约 4 比特量化后不足 20GB,可与感知编码器、KV 缓存及推测解码草稿模型一并放入 24GB 或 32GB 显存环境;
- 运行硬件:在单张 RTX 4090(24GB)上可配置约 13 万 token 上下文,配合 DFlash 推测解码后输出速度约 75 token/s;
- 离线能力:无网络连接下仍可执行工具调用与多步骤任务。
Meta 首席 AI 官、超级智能实验室负责人亚历山大·王强调,这一开放权重「不会削弱」智能体任务的执行稳定性。
基准表现:22 项测试拿下 12 项 SOTA
在与参数规模相近的 Gemma 4 31B、Qwen 3.6 27B 的对比中,Muse Glimmer 在 22 项 Agent、编程、多模态和通用能力测试中拿下 12 项最佳成绩,优势集中在 Agent 与部分推理任务:
- MCP Atlas(多工具串联调度):75.5 分;
- DeepSearch QA(深度检索问答):74.6 分;
- SWE-Bench Pro(编程):51.2 分,略高于 Qwen 3.6 的 50.2 分;
- AIME 2026(数学):94.7 分。
不过,Qwen 3.6 在部分桌面操作、编程与多模态测试中更强,Gemma 4 则在两项安全测试中以更低的违规率与攻击成功率领先。
技术路线:知识蒸馏、4 比特量化与 DFlash 推测解码
完整精度下 Muse Glimmer 体积超过 55GB,超出多数消费级显卡容量。Meta 通过三条主要技术将其压缩至本地可运行:
- 知识蒸馏:以更大规模的 Muse Spark 为教师模型,预训练阶段对其输出做 logit 蒸馏,中期训练加入更长上下文与 Agent 任务,后训练阶段结合 SFT、在线蒸馏与强化学习;
- 4 比特量化:将语言模型权重压至 20GB 以下,与视觉编码器、KV 缓存等一同放入 24–32GB 显存;
- DFlash 推测解码:通过小型草稿模型一次提出多组候选 token,再由 Muse Glimmer 并行验证,在 RTX 5090 上实现 3.1 倍解码加速,在 M5 Max、M4 Max 上分别提升 1.8 倍与 1.5 倍。
开发者实测:离线操作 Mac、可生成多款游戏
多名开发者在本地设备上验证了 Muse Glimmer 的实际表现。一名开发者通过 macOS 辅助功能接口与屏幕图像识别,让模型在本地完成了备忘录新建清单、提醒事项添加日程等任务,并表示这是他第一次感到「离线操作电脑」真正具备可用性,但高延迟仍是一大限制。
AI 平台 Atomic Chat 则对比了三款模型在 RTX 5090 上的本地编程能力:让模型一次生成《太空侵略者》《俄罗斯方块》《打砖块》三款复古街机游戏。结果显示,Muse Glimmer 生成的三款游戏均可正常运行,并具备击杀加速、方块锁定与挡板击碎等逻辑;Gemma 4 的《俄罗斯方块》存在方块堆积问题,Qwen 3.6 的《打砖块》则有球穿过挡板的缺陷。但 Muse Glimmer 也消耗了更多资源——8.34 万 token、17.7 分钟,显著高于 Qwen 3.6 的 2.37 万 token、5.4 分钟和 Gemma 4 的 1.78 万 token、4.5 分钟。
另一名开发者测试了 4 比特量化版本在 RTX 4090 上的部署效率:13 万 token 上下文占用约 19.34GB 显存,输入预处理超 3100 token/s,输出约 50 token/s;启用 DFlash 后输出速度提升至 75 token/s,但显存占用升至 23.93GB。
扎克伯格的超级智能路线
在长文中,扎克伯格阐述了一系列政策与产品主张:
- 模型开放:继续开放部分模型权重,反对通过封闭模型控制技术与用户;
- 产品普惠:向数十亿用户与小企业提供免费或低价的个人 Agent,覆盖健康、职业、财务、学习与家庭管理;
- 隐私保护:推出「连 Meta 自身也无法读取用户数据」的完全私密模式;
- 治理与审查:引入独立董事会审查发布标准,并考虑在训练期间向政府提供模型中间检查点;
- 芯片与基建:加快芯片、能源与数据中心建设,支持继续限制先进芯片对华出口。
他还宣布设立「Future Is For Everyone Fund」基金,用于支持 Meta 在美数据中心所在社区。外媒 Axios 确认该基金初始规模为 10 亿美元(约合人民币 68 亿元),将用于当地教师、急救人员以及能源、水务基础设施建设。
生态接入
Muse Glimmer 权重已上线 Hugging Face,Ollama、LM Studio、Unsloth 将提供直接支持,llama.cpp、ExecuTorch 与 MLX 等本地与端侧框架的优化集成也将陆续上线;vLLM 与 SGLang 可用于部署,PyTorch 的 TorchTitan 支持定制训练。AMD、Arm、戴尔、英特尔、英伟达正参与该模型在不同设备上的性能优化。
