桃子桃子快讯
返回首页
工具

Together AI 详解 LLM 推理自动扩缩容:三项策略仅一项奏效

Together AI 发布技术博文,介绍 Dedicated Inference 在 8 项扩缩容指标上的实践,对比三…

2026.08.10 · 周一2 分钟阅读

AI 基础设施厂商 Together AI 在 X 平台发布了一篇关于 LLM 推理端点自动扩缩容(autoscaling)的技术深度博文,重点解析其 Dedicated Inference 产品在面对真实流量负载时的扩缩容策略选择与实测表现。

自动扩缩容支持八项指标

博文介绍,Dedicated Inference 的自动扩缩容机制可基于八项不同的指标进行触发,涵盖请求队列长度、并发在飞请求、GPU 利用率、显存占用等多个维度。其中,「inflight_requests」(在飞请求数)被设为默认指标,原因是该指标能够比延迟(latency)更早地感知到队列压力,从而在用户体验恶化之前提前触发扩容。

三项策略对比:仅一项有效扩缩容

Together AI 团队在相同负载条件下对三种自动扩缩容策略进行了对照测试,结果显示只有一种策略能够按预期完成扩缩容。博文详细分析了其余两种策略失效的原因,涉及指标响应速度与扩缩容窗口(scaling window)之间的不匹配问题。具体的策略名称、技术实现差异与失效场景需参考原文完整内容。

冷启动时间在单卡 H100 上的实测

除策略对比外,博文还给出了在 1×H100 配置下测得的冷启动时间数据。冷启动是推理服务中影响用户感知延迟的关键因素之一,在自托管或小规模部署场景下尤为突出。Together AI 通过实测数据展示了其 Dedicated Inference 在该硬件条件下的启动表现,为开发者评估平台时延特征提供了参考。

本次博文由 Together AI 的 Soyoung Park 及团队撰写,主要面向在其平台上部署 LLM 推理服务的开发者群体,旨在帮助用户理解平台底层扩缩容机制的取舍,以便更合理地配置推理端点。

信源