桃子桃子快讯
返回首页
研究论文

LLM 服务负载研究:一年期追踪揭示工作负载演变

arXiv 新论文利用 Chutes 一年生产数据,从多维度刻画 LLM 真实服务负载与用户模型交互模式。

2026.08.17 · 周一3 分钟阅读

大型语言模型(LLM)服务已成为云计算中的关键负载,但学界与工业界对生产环境中 LLM 服务的真实运行状况仍缺乏系统、长期的认知。近日发表于 arXiv 的论文《A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing》通过 Chuts 平台长达一年的完整生产追踪数据,对 LLM 服务的实际工作负载进行了多维度刻画,旨在为服务系统的设计与基准测试提供更贴近现实的依据。

研究背景:现有负载研究的局限

当前关于 LLM 服务负载的研究普遍存在样本规模小、观测周期短的不足。许多工作仅基于数天乃至数小时的窗口采样,难以反映用户与模型交互的长期演化趋势,也忽略了生产环境中长尾模型与小众流量的真实分布。聚合视图虽然便于整体分析,却往往掩盖了工作负载的时间结构、模型级差异以及用户层面的行为模式。

作者指出,缺乏真实、完整、长期的负载追踪数据,已经成为制约 LLM 服务系统研究与基准设计的瓶颈。这意味着许多新提出的调度、缓存与负载均衡策略,其评估可能建立在与实际生产流量偏差较大的合成或采样数据之上。

研究方法:Chutes 一年期全局追踪

论文的核心贡献来自 Chutes 平台一年的完整生产追踪数据。Chutes 作为 LLM 服务提供商,其流量覆盖了热门模型与长尾模型在内的多种模型,涵盖大量真实用户的交互行为。与以往研究不同,这一数据集保留了完整的生产行为记录,而不仅仅是聚合统计或采样片段。

研究团队从四个维度对该负载进行了分析:

  • 聚合视角:整体流量规模与分布特征
  • 时间视角:负载随时间的演化规律
  • 模型视角:不同模型之间的流量差异与变化趋势
  • 用户视角:用户与模型之间的交互结构与行为模式

这种多层次的分析框架旨在揭示通常被聚合视图隐藏的工作负载演化规律与用户–模型交互结构。

意义与影响:为后续研究提供开放数据

论文的另一个重要承诺是随文公开发布这一年的完整生产追踪数据。这一做法有望降低后续研究对采样数据或合成负载的依赖,使学界能够在更真实的条件下评估缓存策略、负载均衡算法以及推理调度方案。

对于 LLM 推理基础设施领域的研究者和工程师而言,这项工作提供的不仅是经验数据,更是一种方法论参考:通过长期、多维度的观测来理解生产环境中 LLM 服务的真实形态。随着推理服务在成本、延迟与资源利用率方面的竞争日益激烈,基于真实负载的研究将更具指导意义。

信源