桃子桃子快讯
←返回首页
工具

Splash 1.1.0 发布:Apple Silicon 本地推理新增 GGUF 与 MLX 支持

开源本地 LLM 推理引擎 Splash 发布 1.1.0,新增 GGUF 量化与 MLX 导入,在 M5 Pro 上以…

2026.09.27 · 周日约 2 分钟阅读

面向 Apple Silicon 的开源本地大模型推理引擎 Splash 于近日发布 1.1.0 版本。本次更新带来了对 GGUF 量化格式以及 Apple MLX 模型格式的导入支持,进一步降低了在 Mac 设备上离线运行开源大模型的使用门槛。

核心更新

1.1.0 版本主要包含以下变更:

  • GGUF 量化支持:可直接加载 GGUF 格式的量化模型,与当前主流开源模型生态对齐
  • MLX 模型导入:支持导入 Apple MLX 格式权重,扩展可运行模型范围
  • 推理优化整合:将优化内核、推测解码(speculative decoding)、前缀缓存(prefix cache)以及混合权重(mixed-weight)支持整合于单一程序

性能实测

据发布者介绍,在 M5 Pro 64GB 设备上,使用 Splash 1.1.0 配合 Qwen3 27B 模型的 Unsloth UD-Q4_K_XL 量化版本,可以在 agentic 工作流中以较高质量运行,生成速度约为 50 token / 秒。发布者评价这是 Apple Silicon 本地推理的一项突破。

背景与项目地址

随着 Apple Silicon 芯片性能持续提升,在 Mac 上本地运行大模型的需求不断增长。Splash 通过将多种推理优化技术整合在同一个程序中,为希望离线运行开源 LLM 的开发者与爱好者提供了新的选择。项目已在 GitHub 开源,地址为 github.com/incoai/splash,1.1.0 版本可通过其 releases 页面获取。

信源