工具
Lily 推理引擎在 M5 Max MacBook 上跑 Qwen3.6-35B-A3B,速度超越 MLX-LM
一款名为 Lily 的推理引擎在搭载 M5 Max 的 MacBook Pro 上对 Qwen3.6-35B-A3B 进…
2026.09.03 · 周四约 2 分钟阅读
一款名为 Lily 的本地推理引擎在 X 平台发布基准测试结果:在搭载 M5 Max 芯片的 MacBook Pro 上运行 Qwen3.6-35B-A3B 模型时,其性能优于 MLX-LM。这是 MLX 生态下又一个面向 Apple Silicon 的推理后端尝试,但具体技术实现尚未公开披露。
基准设定与核心数据
测试覆盖 10 种 prompt 长度与 10 种解码上下文长度组合。在这些条件下,官方公布的对比结果为:
- 预填充(prefill)吞吐量平均为 MLX-LM 的 1.23 倍
- 解码(decode)吞吐量平均为 MLX-LM 的 1.35 倍
- 模型输出质量基本保持不变
信息可信度与待核实事项
该结果以 X 推文形式发布,原始链接指向一篇博客文章,但作者尚未公布以下关键信息:
- 完整的测试方法、硬件配置细节与软件版本
- 所用 Qwen3.6-35B-A3B 权重的具体来源(是否为官方发布)
- 是否启用量化、KV cache 优化等可能影响吞吐的参数设置
- 与 vLLM、llama.cpp 等更主流推理框架的横向对比
此外,截至目前 Apple 尚未官方确认 M5 Max 芯片的存在与发布时间,Qwen 团队也未在公开渠道正式宣布 Qwen3.6-35B-A3B 这一版本号,相关信息有待进一步交叉验证。
行业意义
即便数据属实,这一结果的影响范围也较为有限:Apple Silicon 上的本地大模型推理仍属小众场景,MLX-LM 已是相对成熟的参考实现。对于希望在自己 Mac 上跑通 Qwen 系列模型的开发者而言,MLX 生态正在出现更多可选后端,竞争有望推动整体推理效率继续提升;但在缺乏开源代码与可复现测试的前提下,开发者仍需保持审慎,不宜仅凭单方面声明选择工具。
