桃子桃子快讯
返回首页
工具

Expert Sniper:把多台 Mac 拼成一台跑 MoE 大模型

一款利用 MoE 稀疏性的小工具,能让多台普通 Mac 协同运行原本放不下的 MoE 大模型,并提供实测性能数据。

2026.08.26 · 周三5 分钟阅读

MoE(混合专家)大模型之所以能在消费级硬件上跑得动,前提是一个常被忽略的事实:每个 token 只会激活 128 到 256 个专家中的 8 个左右,约 97% 的权重在每次计算中都不会被用到。基于这一点,开源项目 Darkbloom 把这种「稀疏性」推到极致——它把多台 Mac 组成「专家网络」(Expert Network),让每台机器只持有模型专家权重的一部分,跨机器传递的只是微小的激活值,从而把原本单机放不下的大模型「拼」出来。

核心思路:网络瓶颈不是带宽,是协调

项目作者指出,跨机器传递的激活值每层仅约 4 KB,而专家权重每层约 13.5 MB。真正限制推理速度的不是网络,而是聚合后的 SSD 带宽——而 SSD 带宽会随加入网络的机器数量线性增长。这一不等式构成了整套方案的可行性基础:

N × SSD 带宽 × 缓存命中率 > 每 token 字节数 × 目标 tok/s

Expert Sniper 的实现分两层。单机模式下,它把约 0.9–1.4 GB 的「常驻权重」(注意力、归一化、路由器)固定在内存中,其余专家通过 F_NOCACHE + pread 从 SSD 流式读取,配合 LRU 缓存和预取。一个 17–21 GB 的模型只需几 GB 内存就能跑起来。多机模式下,每台节点只负责自己分区内的专家,注意力在驱动节点本地运行,专家计算则被分派到持有活跃专家的远端节点。分区分配采用「集合哈希」(rendezvous hashing),所有节点根据共享名册独立推导出同一映射,新增节点时只需迁移约 1/N 的专家。

实测性能:单机能跑、两机更快

在 16 GB 的 M4 Mac mini 上以 4-bit 量化运行 Qwen3-Coder-30B-A3B(磁盘占用 17 GB)时,单机模式测得 4.0 tok/s、专家缓存命中率 72.5%、有效读取带宽 5.4 GB/s、峰值内存约 3.6 GB——模型体量远大于机器内存,仍可正常推理。

切换到 OLMoE-1B-7B(3.6 GB、64 个专家)时,单机 SSD 流式跑出 14.9 tok/s(命中率 85%,首 token 延迟 1.3 秒);两台节点组成本地网络后,达到 19.3 tok/s,首 token 延迟 0.6 秒,每层往返 2.9 ms,每 token 仅产生约 0.24 MB 网络流量。作者坦承:跨两台物理机器的同等数字「目前是合理推断,不是已测结果」。

另一组数据揭示了「路由偏置」(routing bias)这把双刃剑:在 Qwen3-30B-A3B 上将偏置从 0.0 调至 0.5,速度提升 48%(从 1.15 升至 1.70 tok/s),但解码困惑度上升 5.7%;偏置超过 1.0 之后出现明显的质量悬崖。该工具用「困惑度门控」自动选择偏置——只有当留出集的困惑度变化不超过 5% 时才启用。

入门方式

针对 Apple Silicon(M 系列芯片,16 GB 内存以上),安装与运行非常直接:

  • pip install -e . 安装后,mlx-sniper download qwen3-30b 一键下载并预处理;
  • mlx-sniper runmlx-sniper chatmlx-sniper serve 分别对应一次性推理、交互对话、与 Ollama 兼容的服务接口;
  • mlx-sniper eval 用于在留出文本上跑困惑度评测;
  • 多机模式则通过 expert-node 注册节点,expert-net 启动驱动并接入对话。

支持模型包括 Qwen3-30B/Coder-30B、Qwen3.5-35B/122B、Qwen3-Next-80B、Qwen3-235B,Gemma 4-26B 为实验性。节点默认绑定 127.0.0.1 且无鉴权,作者明确建议仅在受信网络中通过 --host 0.0.0.0 暴露。

工程要点与局限

  • 预分片阶段把 checkpoint 拆成常驻权重(内存常驻)与每层 16 KB 对齐的专家块(SSD 存储),内容寻址块用 sha256 校验,落地到稀疏文件的固定偏移,引擎可直接读取而不需再解压。
  • 一次性的「标定」步骤根据机器内存自适应 LRU 容量,记录跨专家共激活矩阵,并扫描路由偏置。
  • 解码循环被设计为局域网/城域网场景,每层都要往返;广域网仅用于分发内容寻址的专家分片,不参与 token 路径。

需要指出的是,这仍是 v0.2 阶段的实验性项目,单机性能距离原生推理仍有差距,跨物理机的性能也尚未被实测覆盖。但它展示了一条清晰路径:让算力不充裕的个人开发者也能用现成的 Mac 设备协作运行远超大内存容量的 MoE 模型。

信源