桃子桃子快讯
返回首页
研究论文

AWS 提出无屏障同步算法,为 Trainium 加速器降延迟 10–45%

AWS 团队提出针对 Trainium 等多引擎 AI 加速器的无屏障同步算法,编译器层面减少同步开销,相关论文已被 C…

2026.08.18 · 周二3 分钟阅读

AWS 团队近期发表了一篇关于多引擎 AI 加速器同步机制的研究论文,提出一种无屏障同步算法(barrier-free synchronization),专门面向 Trainium 这类由多个专用计算引擎并行执行任务的 AI 芯片。该论文已被 2027 年 IEEE/ACM 国际代码生成与优化研讨会(CGO '27)接收。

研究背景:AI 加速器的同步难题

多引擎 AI 加速器(如 AWS Trainium)内部包含多个并行运行的专用计算引擎,编译器需要负责管理这些引擎之间的数据依赖关系。对于直线型代码,这类依赖关系较为简单:每条依赖都可以归结为「等待一定数量的指令执行完成」,编译器可在静态分析阶段直接算出阈值。

然而,当代码中引入循环结构时,问题变得复杂。一种朴素的做法是在每次循环边界插入全引擎屏障(all-engine barriers),将每个循环迭代重置为独立的直线段来处理。这种做法虽然简单,却会显著牺牲并行度,导致不必要的等待开销。

核心思路:用运行时阈值替代静态屏障

新算法的核心思想是:放弃在循环边界统一插入屏障的做法,转而根据运行时跟踪到的循环迭代次数,动态计算每个数据依赖所需的精确同步阈值。这样可以针对结构化控制流(包括任意嵌套的、动态边界的循环)精确强制每条依赖关系,既不发出过早的消费者指令,也不让消费者指令等待过久。

论文中还给出了「正确同步所需的最小条件」的形式化刻画,并使用 Lean 证明助手,通过互模拟(bisimulation)方法验证了所提算法确实满足该最小条件,从理论上保证了正确性。

落地实现与实测结果

团队将该算法实现为 AWS Neuron ISA 层面的编译器后端 pass,并在多个机器学习内核上进行了评估,主要结果包括:

  • 相对于基于屏障的基线方案,端到端延迟降低 10%–45%;
  • 在一个以同步为瓶颈的微基准测试上获得 3.3 倍加速;
  • 在多数场景下,性能可匹配甚至超过人工手工调优的资源分配方案。

研究意义与适用范围

这项工作的价值在于把同步开销这一长期被忽视的编译器优化问题做了系统性研究,并且做到了形式化验证 + 真实硬件实测的闭环。它主要利好 AWS Trainium 用户与 Neuron 编译器生态,同时也为其他多引擎 AI 加速器的编译器设计提供了可借鉴的思路。对于关注 AI 基础设施性能上限的工程师与研究者而言,这是 CGO '27 上值得关注的一篇系统类论文。

信源