桃子桃子快讯
返回首页
研究论文

Chutes 发布一年 LLM 生产 trace,揭示 serving 负载演化与缓存/负载均衡规律

研究者公开 Chutes 平台一年全量生产 trace,多视角分析 LLM serving 负载演化与用户交互结构。

2026.08.22 · 周六2 分钟阅读

一篇发表于 arXiv 的研究论文《A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing》公开了来自 AI 推理云平台 Chutes 的全年生产 trace,并从多个维度系统刻画了大模型 serving 在真实生产环境中的负载特征与用户交互模式。该数据集将随论文一同发布,供后续研究者复用。

研究背景

大语言模型(LLM) serving 已成为关键云上负载,但现有研究多基于短期观测或采样数据,难以反映用户与模型在生产环境中的真实交互。论文指出,已有 LLM serving 工作负载研究在规模和时间跨度上存在局限,无法完整刻画负载随时间的演化以及用户-模型交互对流量结构的影响。

数据与方法

  • 数据来源:Chutes 平台一年的全量生产 trace,覆盖多款主流与长尾模型。
  • 分析视角:聚合层、时间序列层、模型层与用户层四个维度交叉分析。
  • 研究目标:揭示通常被聚合视图掩盖的负载演化规律与用户-模型交互结构。

主要发现方向

论文重点关注三类生产现象:

  • 工作负载随时间的演化趋势;
  • 缓存命中率与负载均衡策略对系统效率的影响;
  • 不同模型(热门与长尾)之间流量分布的差异。

意义与局限

该工作的价值在于提供了首个跨度一年的真实 LLM serving 全量 trace,使后续 serving 系统设计、调度与缓存策略研究无需再依赖采样或合成数据。但论文聚焦基础设施层面,对终端用户能力评测、模型效果对比等议题无直接覆盖,结论需结合具体 serving 架构理解。

论文编号 arXiv:2608.13573,提交于 2026 年 7 月 3 日,作者 William Nixon,关联 DOI 已通过 DataCite 发布。

信源