Meta首款AI训练芯片MTIA 300亮相,专攻推荐模型
Meta发布其首款AI训练芯片MTIA 300,聚焦深度学习推荐模型,集成网卡芯片、专用消息引擎与近内存计算,性能可比肩…
Meta 正式揭开了其自主研发 AI 训练芯片 MTIA 300 的面纱,这也是该公司在继 MTIA 1(MTIA 100)与 MTIA 2i(MTIA 200)两款推理芯片之后推出的首款训练芯片。MTIA 300 针对深度学习推荐模型(DLRM)进行了专门优化,其设计思路与 GPU 存在明显差异,意在解决 DLRM 训练中浮点运算需求不高、但对大容量内存、高网络带宽和频繁集体通信要求严苛所导致的加速器利用率低下问题。
设计动机:DLRM 与 GenAI 的差异
在 Meta 内部,AI 工作负载主要分为 GenAI 与 DLRM 两大类。DLRM 是 Facebook、Instagram 等产品实现个性化内容分发、广告投放与好友推荐的核心引擎,其结构通常由多层感知器(MLP)处理密集特征、嵌入表处理稀疏特征,通过密集交互层连接。
DLRM 训练有别于 GenAI 训练的两大特征:
- 计算层面:密集组件所需 FLOPS 远低于 GenAI 训练,但稀疏组件需要不定期访问超大嵌入表,且常受限于内存或指令带宽。
- 通信层面:嵌入表往往超过单个加速器内存容量(有时占模型参数 99% 以上),需采用混合并行策略,引入数据并行(AllReduce)与模型并行(AllToAllv)交织的复杂通信模式。
由于上述特性,通用 GPU 在 DLRM 训练中常出现协同操作效率低、加速器利用率不高等问题,这正是 Meta 设计 MTIA 300 的出发点。
三大硬件创新
MTIA 300 通过三项关键设计应对 DLRM 训练的通信与内存挑战:
- 内置网卡芯片:芯片架构内嵌两个网卡芯片,共集成 12 个 800 Gbps RDMA 网卡,可灵活用于纵向或横向扩展网络,并消除加速器与网卡之间的 PCIe 开销。
- 专用消息引擎:用于集体卸载,仅占用约三分之一芯片面积,即可提供与计算引擎相当的通信吞吐量,避免了 GPU 中计算引擎与主机 CPU 处理协同操作时的低效。
- 近内存计算:消息引擎被放置在芯片边缘、靠近 HBM、缓存与 I/O 的位置,配备专用硬件加速 Reduce、AllReduce、ReduceScatter 等基于归约的集合操作。
据 Meta 介绍,MTIA 300 是首款内置网卡芯片和通用集体卸载引擎的加速器,可同时支持高效的纵向扩展与横向扩展通信。
架构概览
MTIA 300 采用芯片组架构,由计算芯片与网络芯片组成。计算芯片采用 12×6 处理单元(PE)网格,内含 16 个消息引擎,东西两侧各连接 3 个 12 层 HBM3E 堆栈,片上通过二维网状 NoC 互联。
单个 PE 的关键规格如下:
- 两个 64 字节宽 RISC-V 矢量内核
- 点积引擎(DPE):两个 32×64B×32 MAC 模块,每 PE 总吞吐 7.82 TFLOPS,支持 FP16/BF16 输入与 FP32 输出,同时支持 FP8(S1E4M3 / S1E5M2)与 TF32 输入
- SIMD 引擎(SFU):每周期处理元素数从 MTIA-2i 的 32 增至 128,GEMM:SIMD 比例为 16:1
- 本地存储:512 KB 循环缓冲区
- 硬件加速基数排序,用于反向嵌入操作
相较 MTIA-2i,MTIA 300 在面积、TDP 上分别提升约 3 倍与 10 倍,改用液冷与 HBM3E,计算精度从 INT8 升级至 FP8,BF16 FLOPS 提升超过 3 倍,FP32 SIMD 能力提升超过 6 倍。
与 GPU 的定位差异
MTIA 300 并非要与 GPU 全面对标,而是采取了差异化的取舍:弱化峰值浮点运算性能,强化 HBM 带宽与网络性能,侧重内置网卡与集体通信卸载。在 DLRM 训练场景下,其性能可与同代 GPU(H100/H200)相媲美,并具备成本优势。
此外,MTIA 300 的中等浮点运算能力与更高 HBM 带宽,也使其同样适用于 GenAI 推理。
后续路线图
Meta 已透露 MTIA 系列的演进计划:
- MTIA 300:与 H100 / H200 GPU 竞争,聚焦 DLRM 训练
- MTIA 400:对标 GB300 GPU
- MTIA 450 / 500:目标是在 GenAI 推理性能上超越未来 GPU,达到业界领先水平
由此可见,MTIA 300 中验证的内置网卡、集体卸载与近内存计算等设计原则已被后续 GenAI 优化型号所沿用,这颗训练芯片既是 Meta 自研芯片体系的重要里程碑,也为后续 GenAI 芯片的迭代奠定了架构基础。
