桃子桃子快讯
返回首页
研究论文

Together AI 提出 ThunderAgent:智能体推理吞吐提升 2.5 倍

Together AI 推出 ThunderAgent,在调度层缓解 KV cache 抖动,单节点吞吐提升 2.5 倍…

2026.07.30 · 周四2 分钟阅读

AI 基础设施厂商 Together AI 近日公布了其智能体推理优化方案 ThunderAgent,并宣布该工作已被 ICML 2026 接收为 Spotlight 论文。该方案聚焦于智能体(agentic)推理场景下的 GPU 资源浪费问题,通过在调度器层面进行改造来缓解 KV cache 抖动带来的性能损失。

问题背景:智能体推理中的 KV cache 抖动

在典型的智能体推理工作流中,一个请求往往会在多轮工具调用、子任务切换之间反复进出模型。由于上下文长度、注意力结构在每一轮都可能发生显著变化,KV cache 容易被反复驱逐与重建,产生所谓的「KV cache thrashing」现象。这一过程会占用大量显存带宽与计算周期,使 GPU 的有效利用率下降,并直接表现为高并发下吞吐受限、尾延迟升高。

方案要点:在调度层解决

ThunderAgent 的核心思路是把优化点放在推理调度器,而非模型本身。具体做法是让调度器感知 KV cache 的复用机会与生命周期,对请求的调度顺序和批处理组合进行调整,从而减少不必要的高速缓存重建。Together AI 给出的官方数据包括:

  • 单节点吞吐提升约 2.5 倍;
  • 高并发场景下 P50 延迟降低约 10 倍。

上述结果意味着,在不更换模型的前提下,仅通过调度策略的改造就能显著释放已有 GPU 的算力。

学术与行业意义

ThunderAgent 已被 ICML 2026 接收为 Spotlight 论文,表明其方法在学术界获得了同行评审层面的认可。对于正在大量部署智能体应用的团队而言,这一类「不改模型、改调度」的优化路径具备较高的落地价值,因为它可以与现有推理栈兼容,直接作用于已有部署。同时,它也反映出智能体推理正在成为大模型基础设施的新瓶颈——围绕 KV cache、调度、上下文管理的优化正在成为独立的研究方向。

信源