AWS 联合 Qumulo 实现大模型跨区域训练
AWS 推出 SageMaker HyperPod 搭配 Qumulo 的跨区域训练方案,远程集群性能可逼近本地集群。
AWS 近日在官方机器学习博客上发布了一篇技术文章,介绍如何将 Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)配合使用,实现在不同 AWS 区域之间的大模型训练,而无需复制训练数据。
背景:跨区域训练的取舍
训练前沿大模型需要大量 GPU 算力,但理想的算力资源和训练数据往往不在同一个 AWS 区域。跨区域访问数据会带来网络延迟和传输成本,团队通常面临两种选择:把 PB 级数据复制到算力所在区域,或者忍受每次读取时的跨区域延迟。前者成本高,后者拖慢训练。AWS 与 Qumulo 的联合方案旨在打破这种两难,让团队在不移动数据的前提下保持吞吐量。
验证结果:远程集群性能追平本地
AWS 在两个集群上运行了同一训练任务进行对比验证:
- Hub 集群:位于 US East(Ohio,us-east-2),与数据共置。
- Spoke 集群:位于 US West(Oregon,us-west-2),通过 CDF 远程读取数据,网络延迟约 60 ms。
训练任务使用 1.02B 参数的 LLaMA v3 模型,每个 HyperPod 集群配备两台 ml.p5.48xlarge 实例(共 16 张 H100 GPU)。结果显示:
- Hub 集群:116–117 样本/秒,18.5 分钟跑完 999 个 batch。
- Spoke 集群(热缓存):115–116 样本/秒,18.5 分钟跑完 999 个 batch,与 Hub 基本持平。
- Spoke 集群(冷启动):前 150 个 batch 慢 15–20%,随后收敛到 Hub 水平。
冷启动的预热阶段在 10,000+ batch 规模下仅占不到 1% 的总训练时间,在 100,000+ batch 规模下占比低于 0.1%。CNQ 的云原生架构使其性能可独立于存储容量扩展,在单区域场景下实现了 99% 的 GPU 利用率和 p5.48xlarge 网络饱和,数据操作延迟低于 3 ms。
架构组成
该方案由三层组成:
- 单一数据源:训练数据集存储在 Hub 区域的 CNQ 实例上,仅保留一份权威拷贝。
- 跨区域访问:每个 HyperPod 集群通过 NFS 挂载本地 CNQ 实例,Spoke 端的 CNQ 通过 VPC 对等连接从 Hub 端获取数据,对计算节点呈现统一的本地挂载路径,无需修改训练代码。
- 智能数据布局:CDF 的核心组件 NeuralCache 使用一个 AI 模型预测训练任务接下来需要的 4 KB 数据块,并将其预缓存到 Spoke 端的 NVMe 上。NeuralCache 学习数据加载器的访问模式,在经过短暂的预热后,使跨区域延迟对训练任务透明。
CDF 的设计允许在 100 ms 以上延迟的网络链路上将单一数据集投射到多个 Spoke CNQ 实例,文件系统元数据在 Spoke 创建后即可在数秒内完成同步,使完整命名空间在文件数据尚未移动时就可浏览。
适用场景与意义
该方案主要面向需要大规模 GPU 集群、但数据驻留在特定区域或本地数据中心的团队。对于不愿承担 PB 级数据复制成本、又无法接受跨区域训练性能损失的组织,这一架构提供了一条可行路径。NeuralCache 的预热开销在大规模训练中可忽略不计,而 GPU 利用率在收敛后可达到 98–100%,与数据共置场景基本一致。
