桃子桃子快讯
←返回首页
工具

Splash 推理引擎针对 40 核 M5 Max 微调内核,解码速度提升约 20%

社区用户在 40 核 M5 Max 上通过内核调优,让 Splash 推理引擎的解码速度较默认配置提升约 20%。

2026.09.25 · 周五约 3 分钟阅读

Splash 是一款面向 Apple Silicon 的本地大模型推理引擎。最近有社区用户在搭载 40 核 M5 Max 的 Mac 上发现,默认内核调度策略并非针对这颗芯片量身定制,通过内置的 "make tune-kernels" 工具自动搜索最优矩阵乘法布局后,解码(decode)阶段性能提升约 20%。这一结果被整理在 Splash 仓库的 issue 中,供其他用户在类似硬件上复现。

背景:默认内核规则的局限

Splash 引擎出厂时的默认内核调度基于 16/20 核 M5 与 32 核 M4 Max 等较小规模芯片的实测数据。当硬件扩展到 40 核 M5 Max 时,原有规则只能依赖启发式猜测,无法保证最优。该引擎在草稿 token 校验阶段会执行一次 8 行步长的量化矩阵乘法,这一环节在更大规模的芯片上仍有较大优化空间。

调优方法与发现

Splash 仓库内置了一个开发者工具 make tune-kernels,其原理是穷举当前硬件上每一种量化矩阵乘法的执行方式,并测量实际耗时。在该用户的 40 核 M5 Max 上:

  • "split-K" 布局(将每个输入行拆成 4 路并行计算,最终再合并部分和)在 8 行草稿校验步骤中明显优于默认布局。
  • --confirm 选项会在最终确认前,对比新旧内核在整个前向传播中的实际加速效果,避免被单步测量误导。

调优完成后,该用户在 40 核 M5 Max 上获得了约 20% 的解码速度提升。

复现步骤

对希望在自己机器上尝试的用户,操作流程如下:

  • 从源码构建 Splash:git clone https://github.com/incoai/splash、git checkout 1.0.2,随后执行 make;需要 Xcode 26+ 及 Metal 工具链。
  • 在空闲的 Mac 上运行 build/engine-tests/tune-kernels build/splash.metallib <你的模型目录> --confirm,让工具自动挑选最优内核并验证整体加速。
  • 使用任意目标模型重新打包,即可在日常推理中享受调优后的性能。

需要注意的是,Splash 已提供 Swift Model 格式的转换结果,例如在 Hugging Face 上的 SiliconSpecies/Swift-1.5-Qwen3.8-27B-Splash 仓库中即可获取转换好的模型文件,方便用户直接替换使用。

小结

对于在高端 Apple Silicon 上运行本地大模型的用户而言,Splash 提供的内核自动调优工具能够在不更换硬件的前提下挤出额外性能。不过该优化高度依赖具体芯片型号与核心数,其收益能否复现到其他 GPU 架构或规模不同的机型,仍需用户自行验证。

信源