桃子桃子快讯
返回首页
开源

Meta 开源 30B 模型 Muse Glimmer,瞄准本地智能体

Meta 发布 30B 权重开源模型 Muse Glimmer,专为本地 agent 工作流设计,4-bit 量化后可在…

2026.08.10 · 周一2 分钟阅读

Meta 正式开源了 30B 参数的密集模型 Muse Glimmer,采用 Apache 2.0 协议,专为本地智能体(agent)工作流而设计。该模型支持文本与图像的交错输入,覆盖 100 多种语言,并提供可控的推理强度调节,方便用户在生成质量与速度之间灵活取舍。

模型规格与本地运行

Muse Glimmer 拥有 300 亿参数,在全精度下需要 55 GB 以上显存,普通消费级硬件难以承载。为此,官方将权重量化至约 4-bit,把语言模型本身的内存占用压到 20 GB 以内,使其能够装入 24 GB 或 32 GB 的显存预算,为 KV cache、感知编码器以及推测解码草稿器留出充足空间。官方表示,在压缩条件下智能体任务的性能损失极小。

推测解码与推理加速

模型配套提供基于 DFlash 的轻量草稿器,以块为单位生成候选 token,由主模型并行验证,相较逐 token 生成在保持输出一致性的前提下显著提速。量化版本的草稿器同样一并发布,以降低额外内存开销。

智能体能力与基准

Muse Glimmer 针对端到端智能体循环任务进行了专门训练,重点能力包括:

  • 长链路函数调用与精确 schema 解析
  • 多步长程推理
  • 工具调用失败后的诊断与重试,避免流程中断
  • 兼容 OpenClaw 等智能体框架
  • 多模态理解与推理

在 DeepSearch QA、MCP-Atlas、τ³-Bench、SWE-Bench 等基准上取得了较强表现。

获取方式与生态合作

权重已上线 Hugging Face(meta-models 组织)。Ollama、LM Studio、Unsloth、torchtitan 等推理框架的适配版本即将推出,同时支持 llama.cpp、MLX、ExecuTorch 的优化集成,以及 vLLM、SGLang 的服务化部署。用户也可通过 Together AI、Fireworks AI、OpenRouter 快速调用。硬件层面,Meta 正与 AMD、Arm、Dell、Intel、NVIDIA 合作进行设备级优化。

信源