桃子桃子快讯
返回首页
研究论文

KernelArc:面向异构负载的多智能体 GPU 内核优化框架

论文 KernelArc 提出多智能体协作的 GPU 内核自动优化方案,在 SOL-ExecBench 多项任务上排名第…

2026.08.19 · 周三2 分钟阅读

KernelArc 是一个用于跨异构负载自动优化 GPU 内核的多智能体框架,相关论文已在 arXiv(cs.AI)发布。该工作聚焦于借助多智能体协同搜索,在固定候选预算下为不同类型 GPU 工作负载生成更强的内核实现。

框架核心机制

KernelArc 由若干「策略专精」的智能体并行运行,并通过三组机制进行协调:

  • 结论型共享内存:智能体之间只共享彼此得出的结论,而非完整轨迹,以减少冗余通信。
  • 确定性基准护栏:对候选实现进行可复现的性能评估,避免随机波动干扰搜索。
  • 只读跨智能体状态 + 平台期触发草拟:在搜索进入平台期时,智能体可基于只读的跨智能体上下文发起新的草拟方案,从而扩大探索范围。

论文强调,整体共享式多智能体搜索有助于在固定预算内拓展探索空间并取得更强结果,但单项协调机制的边际价值会随内核类型与优化阶段而变化。

评测与基准

作者在 NVIDIA H100 与 B200 GPU 上,使用 SOL-ExecBench 中具备类别代表性的工作负载对 KernelArc 进行了评测。生成的实现覆盖了多种典型场景:

  • 自定义 BF16 GEMM;
  • 静态 cuBLASLt Expert-API 配置表;
  • 融合的 Mixture-of-Experts 反向传播;
  • 形状门控的 decoder-layer 融合;
  • 原生 NVFP4 分组查询注意力(GQA);
  • 分页 prefill 注意力。

榜单成绩

在 2026 年 7 月 30 日记录的 SOL-ExecBench 公开榜单快照中,KernelArc 提交的方案在代表性 L1、L2、Quantization 与 FlashInfer 任务上均排名第一。

研究意义

KernelArc 的核心论点在于:相比单智能体或纯人工调优,共享式多智能体框架能够在固定候选预算下获得更强的现有最优解。这一方向对大模型推理与部署中的内核工程具有直接参考价值,相关轨迹数据也可用于后续分析不同协调组件在不同优化阶段的实际贡献。

信源