工具
推理引擎 Lily 针对 Apple 芯片优化 Qwen 部署
新工具 Lily 将 Apple Silicon 作为独立推理平台,把 Qwen 运算直接映射到计算与内存架构,提升端侧…
2026.09.03 · 周四约 2 分钟阅读
一款面向 Apple 设备的推理引擎 Lily 近日正式发布,其核心思路是将 Apple Silicon 视为独立的推理平台,并把通义千问(Qwen)系列模型的运算直接映射到该平台的计算与内存架构上,以提升大模型在苹果设备上的运行效率。
工具定位
Lily 并非通用大模型框架,而是专注解决 Qwen 在 Apple Silicon(涵盖 M 系列及 A 系列芯片)上端侧推理的性能瓶颈。开发者无需依赖云端算力,即可在本机完成 Qwen 模型的加载与推理。
技术思路
- 将 Apple Silicon 视为独立的推理平台,而非 x86 GPU 的简单替代;
- 把 Qwen 的张量运算、内存访问模式与 Apple 芯片的统一内存架构(UMA)以及 Neural Engine / GPU 特性进行底层匹配;
- 目标是降低推理延迟、提升 token 生成吞吐量,减少内存拷贝开销。
现状与意义
目前公开信息中仅透露 Lily 已经可用,并提供了下载链接,但暂未公布具体的 benchmark 数据、支持的 Qwen 模型范围(如 Qwen2、Qwen2.5、Qwen3 等)、量化方案以及与 llama.cpp、MLX 等同类端侧推理框架的横向对比。对于希望在 Mac 或 iPad 上本地运行 Qwen 的开发者与研究人员而言,Apple Silicon 上的原生优化仍有较大需求,Lily 的出现填补了 Qwen 模型在该平台上的特定适配空白,但实际效果仍需等待更详细的技术报告与社区验证。
