兼顾延迟与成本:LLM 延迟感知查询路由新方案
arXiv 论文提出轻量级延迟估计器,将 TTFT 纳入路由决策,在保持同等延迟下将准确率—成本效用提升最高 40%。
在大模型应用规模化部署的背景下,如何在多个模型实例之间高效分配查询,已经成为 LLM 推理服务中的关键工程问题。现有查询路由器通常只权衡响应质量与调用成本,对生成延迟几乎不感知;而业界常用的轮询、最短队列等负载均衡策略,又完全不考虑模型准确率与推理代价。来自 arXiv(编号 2607.18253)的一篇新论文《Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads》正是针对这一空白展开研究。
研究动机:路由决策缺少延迟维度
论文指出,将查询延迟纳入路由之所以困难,原因在于延迟并非仅取决于 prompt 长度,还受到三方面因素的共同影响:
- 模型实例当前的 prefill 与 decode 负载状态;
- 请求队列长度及正在进行的批处理组成;
- 推理框架所采用的调度与批处理策略。
这意味着同一条查询在不同时间被路由到同一模型,端到端延迟可能差异巨大,传统「质量+成本」二元优化路由难以捕捉这种动态性。
方法设计:轻量级延迟估计器
为解决上述问题,作者设计了一个轻量级延迟估计器,其核心思路是模拟推理框架中的自回归 token 批处理过程,从而预测每条查询的首 token 时间(Time-to-First-Token,TTFT)。该估计器不依赖真实推理执行,因此开销可控,可以在线上路由决策中实时调用。
在此基础上,作者构建了一个延迟感知路由器,将延迟、准确率与成本三目标联合纳入路由打分函数,在为每条查询选择模型实例时同时考虑响应质量、调用价格与预估 TTFT。
实验结果:同等延迟下效用提升 40%
论文在多组动态负载场景下对所提路由器进行了评估,关键结论包括:
- 在保持与标准负载均衡策略相同延迟水平的前提下,准确率—成本联合效用最高可提升 40%;
- 延迟估计器对 TTFT 的预测与实测值接近,具备在线部署的可行性;
- 与仅优化准确率或仅优化成本的基线路由器相比,三目标联合路由在动态负载下的表现更稳定。
意义与适用场景
该工作面向的是同时部署多个不同规模或不同价格档位模型的 LLM 服务方,例如需要在大模型与小模型、自托管模型与 API 模型之间做混合调度的平台。对于关注用户体验延迟、又希望最大化每美元推理价值的团队而言,这种「延迟感知 + 多目标联合」的路由思路具有直接的工程参考价值。当然,作为一篇 arXiv 预印本,其方法在更大规模生产环境中的泛化能力与长期稳定性,仍有待后续工作进一步验证。
