Kimi 开源 FlashKDA:在 H20 上实现 1.72–2.22 倍 prefill 加速
Moonshot AI 开源基于 CUTLASS 的 Kimi Delta Attention 高性能内核 FlashK…
Moonshot AI(Kimi)近日通过官方 X 账号宣布,正式开源其高性能 CUDA 注意力内核实现 FlashKDA。该项目基于 NVIDIA CUTLASS 库构建,针对 Kimi Delta Attention(KDA)机制做了深度优化,并可作为 flash-linear-attention 库的直接替换后端使用。开发者无需改动现有调用接口,即可将已有链路切换到这一实现。
官方性能数据
根据 Moonshot AI 公布的信息,FlashKDA 在 NVIDIA H20 GPU 上,相较 flash-linear-attention 基线实现了 1.72 倍至 2.22 倍的 prefill(预填充)阶段加速。这一加速区间覆盖了从短序列到长序列的不同输入长度,意味着该内核在典型的推理和训练场景中均能带来可观的吞吐提升。
与 flash-linear-attention 的兼容性
FlashKDA 的关键设计目标是「即插即用」。它被定位为 flash-linear-attention 的直接替代后端,开发者只需在现有依赖中替换或注册相应模块,即可直接受益于 CUTLASS 级别的内核优化,而无需重写上层训练或推理逻辑。这一兼容性策略降低了社区采纳门槛。
Kimi Delta Attention 的背景
Kimi Delta Attention 是 Moonshot AI 在线性注意力(linear attention)方向上的技术探索之一。相比标准 Transformer 中的 softmax 注意力,线性注意力通过将注意力矩阵的二次计算压缩为线性复杂度,在长序列场景下具备更优的推理效率与显存占用。FlashKDA 的开源相当于把 KDA 在高性能 GPU 层面的高效实现补齐,使该机制更容易在社区框架中被实测与部署。
获取方式
FlashKDA 代码已在 GitHub 开源,开发者可自行获取、集成并反馈。这一发布也延续了 Moonshot AI 在过去几个月中持续向社区输出训练与推理基础设施的一贯节奏。
