桃子桃子快讯
返回首页
研究论文

无问芯穹发布 PDD 跨集群推理架构:首字延迟降 51.5%、单 Token 成本降 37.5%

无问芯穹在 WAIC 2026 首次公开 PDD 跨集群异构推理架构,将传统 PD 分离拆为 P-RLD-MD 三层,通…

2026.07.30 · 周四8 分钟阅读

在 2026 WAIC 世界人工智能大会上,无问芯穹首次公开了其大模型推理系统方面的新成果——跨集群异构推理架构 PDD(Prefill-RelayDecode-MainDecode)。近日,团队将完整技术报告与代码同步释出,详细还原了 PDD 的设计动机、核心机制与实测数据。报告显示,PDD 在 DeepSeek-V4-pro 上以真实 Agent 业务 Trace 测试,可将首 Token 延迟降低 51.5%,并将单 Token 成本下降 37.5%。

行业背景:LLM 推理的成本效率压力

大模型推理长期面临成本与效率的双重挑战。业内公认,LLM 推理在 Prefill(预填充)与 Decode(解码)两个阶段具有截然不同的特性:前者计算密集,后者访存密集。理论上,「异构分离」是理想解法——让算力强的卡负责 Prefill,让显存带宽高的卡负责 Decode。但在工程实践中,要在单集群内同时装配大规模异构算力,成本极高,且模型架构一旦变化,固定配比的硬件容易出现部分闲置。

由此衍生出一个自然设想:将分布在各地的、已建好的同构集群,通过低成本的广域网以太网连接,做「跨集群异构分离推理」。然而真正落地时,会撞上「叹息之墙」——KV Cache 的跨集群传输带宽和延迟瓶颈。PDD 正是为攻克这一难题而设计。

三个核心洞察

PDD 技术报告的 Background 部分提出了三个关键洞察,构成了整套架构的成立前提。

  • 洞察一:硬件极度「偏科」。以 8 卡某旗舰高性能 GPU 为基线测试:某厂商 E 芯片在 Prefill 阶段仅达基线 81% 的性能,但在 Decode 阶段却能爆发到基线 210%。如果把这类芯片放在同构集群里同时承担两类任务,长板无从发挥,反而拖累 Prefill 效率,这直接驱动了团队将 Prefill 与 Decode 解耦并分别部署在最合适的硬件上。
  • 洞察二:DRC 技术带来 10 倍带宽收益。Agent 业务前缀缓存命中率极高。在 Decode 侧部署前缀缓存 RadixCache(DRC)后,Prefill 端命中前缀缓存时只需传输增量 KV Cache。在 90% 平均命中率下,跨集群带宽需求理论上可降低 10 倍。
  • 洞察三:Agent 工作负载的「非均匀延迟」。智能体业务三大特征:上下文极长(动辄 64K)、缓存命中率极高(平均 90%)、输出却极短(经常少于 100 Token)。团队分析了线上 600 万条真实请求,约 30% 输出 Token 数少于 100 个,约 40% 不超过 500 个;而 1–20 秒的 KV Cache 传输在这些请求的端到端延迟中占比高达 43%–56%。

进一步分析请求命中率分布后发现:约 70%–80% 的请求命中率在 95% 以上,只有极少数低命中率请求携带巨大 KV Cache。在 20 Gbps 跨集群专线上的微基准测试中,「真实偏斜分布」下 P50 传输延迟仅 248 ms;但若命中率人为均匀化(85%–95%),网络连接池瞬间被打满,P50 延迟飙升至 1210 ms。这意味着:极端延迟只集中在极少数低命中率「刺头请求」上,要解的不是全局网络延迟,而是针对这少部分请求做优化。

PDD 架构:用「接力赛」掩藏网络延迟

基于上述洞察,PDD 在传统「P–D」两级分离中插入了一个中继层 RL(RelayDecode),形成 P–RLD–MD 三级推理架构:

  • P 实例:位于主集群,处理输入 Prompt 并生成 KV Cache。
  • RLD 实例:与 P 同集群,通过高速 RDMA 网络互联(KV 传输延迟仅几十毫秒)。
  • MD 实例:位于外地的远端集群,通过广域网以太网与主集群相连(KV 传输延迟数秒级)。

工作过程可以类比一场 2×100 米接力:P 实例计算完 Prefill 后,同时把 KV Cache 通过 RDMA「瞬时」传给同机房 RLD,并通过慢速以太网传给远端 MD;RLD 拿到 KV 后立刻开始解码并将 Token 推给用户,用户几乎感知不到后台正在进行的跨集群传输;几秒后 MD 收齐 KV,再由 MD 完成后续主要 Token 生成。这一设计将「不可控的网络传输」转化为「本地确定性计算」,从而显著改善首字延迟体验。

接力交接:只传 Token,本地重算

三级架构的最大工程难点在于 RLD 与 MD 之间如何无缝交接解码任务。传统做法是让 RLD 把增量 KV Cache 通过以太网传给 MD,但跨域网络延迟加 H2D/D2H 拷贝代价高昂。为此,无问芯穹提出了反直觉但高效的「Extend-Decode Handoff」机制:RLD 不传庞大 KV Cache,只把生成的 Token ID 传给 MD(数据量仅几 KB);MD 端利用常见于 MTP 多 Token 预测与投机解码中的 Extend-Decode 技术,本地重算这些 Token 对应的 KV Cache,并继续生成下一个新 Token。

由于 Decode 阶段是访存密集型,计算本身很轻量,MD 端重算 100 个 Token 的 KV Cache 平均仅耗时 305.2 ms,最大延迟锁定在 321.4 ms,标准差仅 4.8 ms。相比之下,以太网直传 KV Cache 平均耗时 185.4 ms,但峰值可达 512.6 ms,标准差 96.3 ms,且还有 24.5 ms 的 H2D/D2H 开销未计。

此外,团队设计了「追赶式」与「一次性」两种交接模式,可根据实时负载动态切换。

流水线编排:让中继站「只藏延迟不干重活」

为避免 RLD 成为系统瓶颈,PDD 的流水线按命中率分两路:

  • P–MD 流水线:命中率 >95% 的高频请求(占 70%+),数据包极小,直接走以太网传给 MD,无需 RLD 中继。
  • P–RLD–MD 流水线:只有命中率低、数据包大的「刺头请求」才送 RLD 做延迟掩藏。

实测中,RLD 仅承担系统 6.2% 的 Token 生成任务(约 27 万 Token),而远端 MD 包揽了 93.8% 的重活(约 412 万 Token),二者负载差近 15 倍。同时,这种设计保证了 MD 端缓存命中率始终与 P 端一致,避免出现「将请求生命周期终结于 RLD」所引发的恶性正反馈循环。

实测成绩

团队在 DeepSeek-V4-pro 模型上,使用真实 Agent 业务 Trace,将 PDD 与两组基线对比:CDC-PD(跨集群 + DRC 但无 RLD 掩藏)、IDC-PD(单机房同构 PD 分离)。结果如下:

  • 首字延迟:CDC-PD 的 P90 TTFT 高达 18.3 秒,P99 逼近 30 秒;PDD 将 P90 TTFT 降至 9.8 秒(下降约 46%),P99 降至 14.4 秒。
  • 用户侧综合指标:首 Token 延迟降低 51.5%,单 Token 成本下降 37.5%。
  • 负载分布:RLD 仅承担 6.2% Token 生成,MD 承担 93.8%,负载差异达 15.2 倍。

综合来看,PDD 通过「RelayDecode 中继 + Extend-Decode Handoff + 偏斜感知流水线编排」三件套,把跨集群异构推理从「受网络波动影响、不可控」的状态,改造为「本地确定性、可预测」的推理路径,在不增加硬件采购成本的前提下,显著改善了延迟体验与单位算力产出。这套架构尤其适配 Agent 这类「长输入、短输出、高前缀命中率」的工作负载。技术报告与代码已在 GitHub 开源,感兴趣的开发者和研究者可前往 https://github.com/infinigence/pdd 查看完整细节。

信源