桃子桃子快讯
返回首页
工具

Muse Glimmer 30B 在 Mac 上提速至 3.3 倍:社区推出推测解码工具 mlx-dspark

开发者 A-Rahim3 在 Apple Silicon 上为 Meta Muse Glimmer 30B 实现推测解码…

2026.08.13 · 周四2 分钟阅读

一名社区开发者在 Apple Silicon Mac 上针对 Meta 新发布的 Muse Glimmer 30B 模型实现了推测解码(speculative decoding),并开源了相关项目 mlx-dspark。在其自用的 M4 Pro 设备上,8-bit 量化版本的推理速度从基线的 8.2 tok/s 提升至 18–26 tok/s,不同任务类型下的加速比依次为:数学 3.27 倍、代码 2.5 倍、对话 2.22 倍。由于目标模型逐 token 验证草稿输出,最终生成结果与常规解码完全一致,不存在质量损失。

性能与资源占用

  • 8-bit 量化:速度提升 2.2–22×,峰值显存约 40 GB,推荐使用 48 GB 统一内存的 Mac。
  • 4-bit 量化:加速比约 1.7×,吞吐可达 25 tok/s 左右,显存占用降至约 18 GB。
  • 整体目标:"以 4-bit 的速度获得 8-bit 的质量"。

与官方 DFlash 的对比

作者将其结果与 Meta 此前公布的 DFlash 方案做了横向参照:DFlash 在 M4 Max 上为约 1.5 倍、M5 Max 上约 1.8 倍加速,但官方数字基于 4-bit 构建。作者也指出两者并非完全可比口径,因此重点强调 mlx-dspark 在 8-bit 路径上实现了更高的加速幅度。

适用场景与限制

  • 适用人群:在 Apple Silicon Mac 上本地运行 30B 级开源模型的开发者与研究者。
  • 硬件门槛:8-bit 模式需要较大内存(48 GB+),4-bit 模式门槛显著降低。
  • 项目状态:作者公开了 GitHub 仓库(ARahim3/mlx-dspark),并征求社区在不同 M 系列芯片上的反馈与测试结果。

目前该方案仍是社区层面的工具与调优分享,并非 Meta 官方发布的推理框架。能否推广到更多模型与硬件配置,以及在长上下文场景下的稳定性,仍有待进一步验证。

信源