桃子桃子快讯
返回首页
研究论文

Agent 集群用 40 小时把类 Kimi 模型推理提速 6 倍

研究者在 WebGPU 上用一群 AI Agent 自动优化类 Kimi K3 模型推理,吞吐量从 65 tok/s 提…

2026.07.25 · 周六3 分钟阅读

近日,r/LocalLLaMA 社区用户 xenovatech 发布了一段可视化动画,展示了一个由「GPT 5.6 Sol」类 Agent 组成的集群对类 Kimi K3 模型进行自动化推理内核优化的全过程。整个优化过程耗时超过 40 小时,最终将模型在 WebGPU 上的单 token 生成吞吐量从 65 tok/s 提升至 406 tok/s,提速约 6.2 倍。这是近期少数明确给出端到端加速数字、并展示 Agent 在底层编译器层面工作的案例。

优化目标与结果

被优化的对象是一个参数量与架构与 Kimi K3 相近的 MoE 大模型,运行在浏览器端的 WebGPU 环境上。优化前的初始执行图是一个完全展开的 Kimi Linear 计算图,包含 331 个独立算子节点;优化后被融合压缩为仅需 22 次 GPU 调度即可完成单 token 推理的紧凑版本。

关键数字:

  • 吞吐量:65 → 406 tok/s(约 6.2×)
  • 单 token GPU 调度次数:331 → 22
  • 优化耗时:40 小时以上
  • 优化主体:由多个 Agent 组成的集群协同

优化手段

可视化动画追踪了 Agent 集群在 40 多个小时中的协作过程,主要工作集中在三个方面:

  • 算子融合(operator fusion):把多个连续算子合并为单个 GPU 内核,减少调度开销与中间张量读写。
  • 执行图重写(execution graph transformation):对计算图拓扑进行重新组织,提升并行度与访存局部性。
  • 新内核算法开发:为模型中的关键模块编写定制化的 WebGPU 内核,绕开通用算子库的性能瓶颈。

最大的性能增益来自三类针对 MoE 架构专门编写的 WebGPU 内核:

  • Kimi Delta Attention(KDA):针对线性/卷积式注意力的定制实现。
  • Multi-Head Latent Attention(MLA):针对低秩潜在注意力结构的优化。
  • Mixture of Experts(MoE):针对专家路由与权重加载的高效调度。

背景与意义

WebGPU 已成为浏览器与边缘设备运行大模型的重要平台,但其驱动与算子库相对 CUDA 生态尚不成熟,许多大模型架构(尤其是带有 MLA、KDA、MoE 等复杂模块的 Kimi 系列)缺少开箱即用的高性能内核。传统上这类工作依赖人工调优或专用编译框架(如 MLC-LLM、TensorRT-LLM),而本案例展示了由 LLM 驱动的 Agent 集群在没有人工干预的情况下自主发现融合机会并写出可工作的 WebGPU 内核的可能性。

后续

提交者表示,完整的优化框架将在未来公开发布,但本次帖文中未给出代码仓库链接、benchmark 设置、对比基线或硬件规格等细节,因此上述数字目前仅来自单一来源的可视化展示,尚需等待官方释出后进一步验证。

信源