桃子桃子快讯
返回首页
行业动态

在消费级硬件上跑大模型:分布式推理的三条路径

Redis 作者 antirez 探讨用 Mac Studio、DGX Spark 等设备组合进行 LLM 分布式推理,…

2026.07.28 · 周二4 分钟阅读

在算力紧缺、显存昂贵的大背景下,把大模型跑在本地消费级硬件上正在成为一种现实选项。Redis 作者 antirez(Salvatore Sanfilippo)近日撰文,结合自己的 DwarfStar 项目,详细讨论了当前 Mac Studio、DGX Spark 等设备的本地推理能力,以及当单机资源不足时,三种可行的分布式推理路径。

本地推理的硬件现状

作者指出,跑前沿模型所需的显存和算力,使 NVIDIA 高端显卡及配套服务器成本居高不下。作为替代方案,Apple 硬件与 DGX Spark 进入了玩家视野:DGX Spark 内存带宽有限,但足以让 prompt 处理(prefill)足够快;Mac Studio M3 Ultra 512GB 则提供统一内存,内存带宽虽不及 NVIDIA 顶级方案,但优于 Spark,且价格相对合理。

实测数据显示,在 DwarfStar 项目下,Mac Studio M3 Ultra 512GB 可让 DeepSeek v4 PRO(2-bit 量化)跑到约 150 t/s prefill、10–13 t/s 解码速度。作者认为,虽然不算快,但在 1.2 万美元左右的总投入下,能在家用环境跑前沿模型本身已是值得关注的事实。

当前最具性价比的方案:M5 Max 笔电

作者认为,从综合性价比看,目前本地推理的最佳设备反而可能是 M5 Max 128GB 笔电。该机型可以以 2-bit 量化运行 DeepSeek v4 Flash 和 Mimo V2.5 等模型,prefill 约 500 t/s、解码 35–40 t/s,且随上下文增长的性能衰减可以接受。整机价格 6000–7000 美元,被作者称为「当下最划算的选择之一」。

不过作者也提到,受限于内存供应紧张,Mac Studio 是否会推出配备更大内存带宽的 M5 Ultra 仍不明朗,这给本地推理前景带来了不确定性。

三种分布式推理路径

当单机资源不足时,作者梳理了三种把多台机器串起来跑模型的方法:

  • 层级切分(pipeline 并行):将 transformer 层一分为二,分别加载到两台机器上,仅在机器间传递激活值。配合 micro-batching 还能提升 prefill 速度,但解码仍是串行依赖。作者举例,拥有两台 Mac Studio 512GB 的用户可以借此跑完整规模的 DeepSeek v4 PRO。
  • 专家切分(利用 Apple RDMA):两台机器各自加载相同的 2-bit 量化模型,各自保留全部 routed expert,再把每层一半专家的计算分到对端机器。由于 routed expert 体积较大、通信开销相对可控,这种方式更适合 PRO 版本。不过作者承认「能否真正做好仍待验证」。
  • 模型集成(shared-nothing 方案):作者将这一思路作为重点提出。近期 arXiv 上的研究(2502.18036)指出,LLM 集成是被低估的方向——两台机器各自跑一个模型,最终在 logits 层面合并或选择置信度更高的续写,等价于一个由路由隐式决定的「双专家 MoE」。即使两模型词表不同,也能基于 perplexity 挑选续写,或将 logits 混合后再采样。

作者补充,张量并行(tensor parallelism)虽然在 NVIDIA NVLink 高速互联下可行,但在 Apple 设备之间基本不现实;而前两种方案的共同优势是机器间传输数据量很小。

集成的现实意义

在 128GB 2-bit 量化这一档位,可选的优质开源模型越来越多,如 Minimax M2.7、Mimo V2.5、DeepSeek v4 Flash 等。作者认为,这为「集成式分布式推理」提供了基础条件:不需要共享内存,不需要高速互联,仅凭推理结束后的 logits 合并或续写筛选,就可能让两个模型的表现超过各自单独运行。

这一思路的吸引力在于门槛极低——任何两台能独立跑模型的机器都能参与。作者表示,他希望在接下来几个月有更多时间亲自试验这些方法,并将其纳入 DwarfStar 项目的探索方向。

信源