桃子桃子快讯
返回首页
工具

Slipstream:让 36GB 内存 MacBook 流式跑 35B–480B MoE 模型

开发者 fork llama.cpp,通过从 SSD 流式加载 MoE 专家权重,让小内存 Mac 也能跑大模型,并公开…

2026.07.26 · 周日3 分钟阅读

Slipstream 是一款 macOS 原生应用,由开发者 fork 自 llama.cpp,专门面向 Apple Silicon 设计。它通过从 SSD 流式加载 MoE 模型的专家权重,让仅有 36 GB 统一内存的 MacBook 也能运行 35B 至 480B 参数规模的编码模型。应用以自包含的 .dmg 形式分发,下载后拖入 Applications 即可使用,无需编译任何组件。本地暴露 localhost:8080 接口,可接入 Kilo、Cline、Cursor、OpenCode 等编码工具。由于尚未经过苹果公证,首次启动需要右键选择「打开」。

核心机制

Slipstream 利用了 MoE 模型「每个 token 仅激活少数专家」的特性:把模型中始终需要的基础权重常驻 RAM,其余被路由到的专家按需从 SSD 流入一个受控缓存。缓存设有上限,超过容量阈值的加载请求会被直接拒绝,以避免触发 macOS 的 swap,保证系统其余进程的可用内存。

实测基准

数据均来自开发者公布的 BENCHMARKS.md:

  • Qwen3.6-35B-A3B(Q4 量化),从内置 NVMe 流式加载:10 GiB 缓存下约 13 tok/s,命中率 78%;14 GiB 缓存下约 19 tok/s。开发者将其定位为「交互级工作马」。
  • Laguna 118B-A8B(参数远超 36 GB 容量):约 2.8 tok/s,适合批量编码任务,不适合对话场景。
  • 性能最大杠杆并非更聪明的内核:把单个流式加载的专家文件挪到更快的磁盘上,获得了约 2.7× 提速。存储位置的影响远大于算法细节。
  • 一条此前被认为价值有限的零拷贝路径,在真实缓存规模下实测带来 +13% 到 +24% 的提升,现已默认开启。

公开的失败案例

开发者明确列出未奏效的尝试:

  • 双 SSD 条带化(内置 NVMe 搭配慢速 USB,共用总线):结果为负。
  • 静态与在线投机预取预测器:相比基线下降 8%,预取开销高于收益。
  • HOT 专家预留策略:下降 1%–6%,原因是挤占了通用缓存的容量。

项目状态与致谢

Slipstream 代码以 MIT 协议开源,100% 本地运行,无云端依赖。其思路参考了面向 CPU/CUDA 的 JustVugg/colibri,本次实现改写为 Apple Silicon + Metal 路径。开发者邀请拥有双高速 NVMe 的用户测试双 SSD 路径,并表示愿意解答与基准相关的问题。

信源