Meta 开源 MetaRoCE:为百万 GPU 规模 AI 训练重写 RDMA 传输
Meta 通过 OCP 发布全新 RDMA 传输协议 MetaRoCE,专为 AI 负载在商用以太网上运行而设计。
Meta 近日通过开放计算项目(Open Compute Project,OCP)正式发布 MetaRoCE——一套为 AI 规模以太网「从零设计」的 RDMA(远程直接内存访问)传输协议,包含规范文档、参考软件实现以及一致性测试套件,面向业界开放采用与扩展。这是 Meta 在推动「以太网成为 AI 基础设施首选网络 fabric」方向上的又一关键动作。
背景:AI 集群为何需要新传输协议
Meta 已经将集群扩展到数十万块 GPU,跨多个数据中心和地域部署。这些集群既要支撑下一代前沿模型的训练,也要在全球范围内提供推理服务,网络都处于关键路径上。集合通信(如 all-reduce、all-to-all)在训练中同步成千上万台加速器,最慢的传输决定了整个作业的节奏;推理中分布式模型分片之间的低时延通信,则直接影响数亿用户的响应时间。即便很小比例的网络摩擦,也会让可观算力被白白空转。
标准 RoCE 假设网络按序交付每个帧,依赖 PFC(Priority Flow Control,基于优先级的流控)并抑制数据包喷洒(packet spraying)——而后者恰恰是大型多平面(multiplane)网络获得性能的关键。MetaRoCE 的设计目标正是:在加速器数量与节点距离持续增长的同时,提供高吞吐、低尾时延和运维简洁性。
核心设计:把智能从网络搬到端点
MetaRoCE 的核心思路被概括为一句话:「fabric 看到的是数据包,NIC(网卡)看到的是意图」。传统架构把智能集中在 fabric,由交换机强制无损并维持顺序;MetaRoCE 将智能移到端点,把网络拆解为大量细粒度逻辑路径,每条路径都携带独立的实时遥测——路径 RTT(往返时延)、ECN(显式拥塞通知)状态、利用率。这种端点可见性解锁了传统 RDMA 难以实现的能力。
其关键技术特性包括:
- 原生乱序交付:数据包按设计就会乱序到达;每个包自带目的地址,到达后直接写入最终内存,无需重排序缓冲,也不会产生头阻塞。
- 原生多路径:每条连接拥有一等路径,按包粒度喷洒;每条路径用不同 UDP 源端口作为 ECMP(等价多路径路由)熵,网卡可随时切换以绕开故障路径。在多平面 fabric 上,平面选择完全交给网卡。
- 设计上的容损:将以太网视为有损网络,不要求 PFC;256 位选择性确认位向量中出现空隙即代表丢包而非乱序,从而精准触发缺失包在丢包路径上的重传。
- 双侧拥塞控制:在传统基于 ECN 的发送端 AIMD(加性增乘性减)基础上叠加接收端公平速率提示;窗口按路径维护,单条路径拥塞只修剪该路径;接收方在每个 ACK 中返回其分配给该发送方的入站带宽比例,使发送方更快收敛到合适速率。
- 拓扑无关:仅要求交换机提供 ECN 标记和 ECMP 即可运行,不依赖 packet trimming、in-network telemetry、credit-based flow control 或交换机端喷洒。同一传输可在胖树、多平面、深缓冲、浅缓冲 fabric,以及配置不可控的第三方云网络上工作。
- 统一连接:单条连接承载多个独立有序消息流和多个路径,由一个拥塞控制器管理,连接状态不再随并行度线性增长。
应用层兼容与未来方向
MetaRoCE 在应用层保持与现有 RDMA Verbs API 及软件栈兼容,现有代码几乎无需修改即可运行;增强特性(如多平面支持)通过扩展 API 提供。这意味着业界既有的集合通信库、训练框架可以平滑迁移到 MetaRoCE,无需大规模重写。
通过将规范、参考实现与测试套件一并交由 OCP 托管,Meta 期望降低业界实现与采纳门槛,让供应商、云服务商与超大规模运营商都能在此基础上构建。Meta 强调,MetaRoCE 中不包含任何专有组件,fabric 可继续按成本与布线最优解演进,而端点传输则统一为面向百万 GPU 规模的 RDMA 路径。
