桃子桃子快讯
返回首页
工具

Lily 推理引擎在 M5 Max MacBook 上跑 Qwen3.6-35B-A3B,速度超越 MLX-LM

一款名为 Lily 的推理引擎在搭载 M5 Max 的 MacBook Pro 上对 Qwen3.6-35B-A3B 进…

2026.09.03 · 周四2 分钟阅读

一款名为 Lily 的本地推理引擎在 X 平台发布基准测试结果:在搭载 M5 Max 芯片的 MacBook Pro 上运行 Qwen3.6-35B-A3B 模型时,其性能优于 MLX-LM。这是 MLX 生态下又一个面向 Apple Silicon 的推理后端尝试,但具体技术实现尚未公开披露。

基准设定与核心数据

测试覆盖 10 种 prompt 长度与 10 种解码上下文长度组合。在这些条件下,官方公布的对比结果为:

  • 预填充(prefill)吞吐量平均为 MLX-LM 的 1.23 倍
  • 解码(decode)吞吐量平均为 MLX-LM 的 1.35 倍
  • 模型输出质量基本保持不变

信息可信度与待核实事项

该结果以 X 推文形式发布,原始链接指向一篇博客文章,但作者尚未公布以下关键信息:

  • 完整的测试方法、硬件配置细节与软件版本
  • 所用 Qwen3.6-35B-A3B 权重的具体来源(是否为官方发布)
  • 是否启用量化、KV cache 优化等可能影响吞吐的参数设置
  • 与 vLLM、llama.cpp 等更主流推理框架的横向对比

此外,截至目前 Apple 尚未官方确认 M5 Max 芯片的存在与发布时间,Qwen 团队也未在公开渠道正式宣布 Qwen3.6-35B-A3B 这一版本号,相关信息有待进一步交叉验证。

行业意义

即便数据属实,这一结果的影响范围也较为有限:Apple Silicon 上的本地大模型推理仍属小众场景,MLX-LM 已是相对成熟的参考实现。对于希望在自己 Mac 上跑通 Qwen 系列模型的开发者而言,MLX 生态正在出现更多可选后端,竞争有望推动整体推理效率继续提升;但在缺乏开源代码与可复现测试的前提下,开发者仍需保持审慎,不宜仅凭单方面声明选择工具。

信源