工具
Splash 1.1.0 发布:Apple Silicon 本地推理新增 GGUF 与 MLX 支持
开源本地 LLM 推理引擎 Splash 发布 1.1.0,新增 GGUF 量化与 MLX 导入,在 M5 Pro 上以…
2026.09.27 · 周日约 2 分钟阅读
面向 Apple Silicon 的开源本地大模型推理引擎 Splash 于近日发布 1.1.0 版本。本次更新带来了对 GGUF 量化格式以及 Apple MLX 模型格式的导入支持,进一步降低了在 Mac 设备上离线运行开源大模型的使用门槛。
核心更新
1.1.0 版本主要包含以下变更:
- GGUF 量化支持:可直接加载 GGUF 格式的量化模型,与当前主流开源模型生态对齐
- MLX 模型导入:支持导入 Apple MLX 格式权重,扩展可运行模型范围
- 推理优化整合:将优化内核、推测解码(speculative decoding)、前缀缓存(prefix cache)以及混合权重(mixed-weight)支持整合于单一程序
性能实测
据发布者介绍,在 M5 Pro 64GB 设备上,使用 Splash 1.1.0 配合 Qwen3 27B 模型的 Unsloth UD-Q4_K_XL 量化版本,可以在 agentic 工作流中以较高质量运行,生成速度约为 50 token / 秒。发布者评价这是 Apple Silicon 本地推理的一项突破。
背景与项目地址
随着 Apple Silicon 芯片性能持续提升,在 Mac 上本地运行大模型的需求不断增长。Splash 通过将多种推理优化技术整合在同一个程序中,为希望离线运行开源 LLM 的开发者与爱好者提供了新的选择。项目已在 GitHub 开源,地址为 github.com/incoai/splash,1.1.0 版本可通过其 releases 页面获取。
