开源
DistribAI v2:跨消费级设备做分布式训练
个人开发者发布 DistribAI v2,基于 C++ 与 Libtorch,可跨 Colab、Kaggle 等免费 G…
2026.09.26 · 周六约 2 分钟阅读
事件概述
Reddit 用户 /u/Enderchef 在 r/LocalLLaMA 发布了 DistribAI v2,这是一款面向分布式训练的实验性平台。据作者介绍,新版本基于 C++ 与 Libtorch 构建,能够把多台消费级设备的算力与显存聚合起来,用以训练不同体量的模型。
核心特性
作者在原帖中列出了 DistribAI v2 的几个关键能力:
- 跨设备协同:可同时调度 Colab、Kaggle、Molab 等平台的免费 GPU,以及本地显卡,统一纳管为一台「训练机」。
- 容错处理:内置对节点崩溃、恶意节点、网络不稳定等异常情况的处理逻辑。
- PyTorch 兼容:支持运行 PyTorch 训练脚本,无需大幅改动原有代码。
- 零成本托管:通过 shareable join link 与 Cloudflared / ngrok 隧道,可在不租用服务器的情况下对外提供接入。
作者给出一组自测数据:在一块免费的 Colab / Kaggle / Molab GPU 加一张本地 RTX 4070 SUPER 的组合下,获得的等效算力约相当于「两块满载 RTX 5090」,可用显存约相当于「五块满载 RTX 5090」,均免费获得。
局限与待观察点
需要指出的是,这一比较由项目作者本人在 Reddit 帖中给出,缺少第三方独立复现,也未提供 benchmark、训练任务细节、收敛曲线等可验证的指标。DistribAI v2 由 naxium-oss 组织在 GitHub 开源,目前仍处于早期阶段,社区反响与实际可用性有待观察。
背景
分布式训练并非新议题,主流深度学习框架普遍内置了多卡、多机方案。DistribAI 的差异化在于把「使用免费云 GPU + 家用显卡」作为入门路径,面向希望在没有昂贵硬件的前提下做小规模训练实验的个人开发者与小型团队,但其能否稳定支撑生产级训练仍是未知数。
