AMD 详解 CDNA5 架构与 MI455 加速器
AMD 首席架构师在 Advancing AI 2026 上解读 CDNA5 从 GCN 转向 RDNA 的设计权衡,以…
AMD 在 Advancing AI 2026 活动上正式公布了新一代数据中心 GPU 架构 CDNA5 与对应的 MI455 加速器,并由公司 Corporate Fellow、数据中心 GPU 首席架构师 Alan Smith 在专访中深入解读了背后的设计考量。
从 GCN 到 RDNA:架构基础的重大重构
AMD 此前的 CDNA 系列一直基于 GCN 架构,可追溯至 2012 年的 Tahiti。CDNA5 首次将底层架构迁移至 RDNA。Alan Smith 表示,迁移的核心动机之一是拥抱现代架构,改进此前的缓存系统与执行引擎,包括任务调度、波次排序与指令发射等关键环节。
更深层的考量在于统一 AMD 的 GPU 路线图。Smith 强调,AI 已经无处不在——从游戏端的神经渲染与超采样,到数据中心的训练与推理,AMD 希望让两条产品线能够共享底层优化成果,从而在未来获得双向收益。
HPC 与 AI:chiplet 层面的差异化
CDNA5 延续了 AMD 的小芯片策略,针对 HPC 与 AI 两种负载分别优化计算 chiplet:
- HPC 方向:保留完整的 IEEE 双精度(FP64)浮点支持,满足传统科学仿真的精度需求
- AI 方向:追求最高的向量与张量吞吐能力,针对 AI 工作负载做极致优化
两者在工作组处理器(WGP)层面仍共享大量基础设施,包括寄存器文件带宽、LDS、缓存、前端调度器以及向量 ALU 所使用的 SIMD,仅通过调整 SIMD 内部双精度单元的数量来实现差异化。
SIMD32 与 Wave32:常见性能优先
CDNA5 在 SIMD 层面有显著变化:从此前的 4 个 SIMD16(Wave64,每四周期发射一条指令)改为 4 个 SIMD32(Wave32,每周期发射一条指令),并正式弃用 Wave64 支持。
Smith 解释道,虽然在 SIMD32 上借助 Wave64 在少数特殊场景仍可获得少量额外效率,但分支发散与寄存器压力带来的开销更大。根据 AMD 对工作负载的剖析数据,绝大多数常见场景下 Wave32 是更优选择,因此选择放弃 Wave64 以换取更优的整体性能。
仍未披露的细节
原访谈在讨论 RDNA 3/4 的额外 ALU 阵列问题时被截断,CDNA5 是否在 SIMD 中配置额外的 32 个 ALU 尚未给出完整答案,相关规格细节仍待 AMD 后续正式文档补充。
