桃子桃子快讯
返回首页
行业动态

商汤大装置分享异构混推实践:日均Token服务半年增近10倍

商汤大装置在AI芯片峰会披露异构推理架构与实践,日均Token服务量从2月0.46万亿增至8月4.5万亿。

2026.09.23 · 周三3 分钟阅读

在 2026 全球 AI 芯片峰会·Token 工厂异构混训混推技术研讨会上,商汤大装置资深技术专家罗伟以《Token 工厂:以异构算力构建新一代 AI 基础设施》为题发表演讲,系统梳理了 Agent 时代规模化推理面临的新挑战,并分享商汤大装置在异构推理架构、模型适配与关键技术演进上的工程实践。

行业挑战:推理负载瓶颈贯穿整套系统

罗伟指出,Token 经济的加速爆发正在重塑算力需求的结构,推理已取代训练成为算力增长主引擎。随着 Token 调用量向千倍级增长,推理系统在长上下文、多轮对话、突发与长尾流量等 Agent 时代典型负载面前压力凸显。

商汤大装置将底层设计逻辑转向「以 Token、状态与时延预算为中心」,所有资源组织都围绕 Token 生产效率、交付质量与单位成本展开。依托该设计,其日均 Token 服务量已从 2026 年 2 月的 0.46 万亿,增长至 8 月的 4.5 万亿,半年内提升近 10 倍。

横向编排与纵向优化:把单点效率组织成系统级产能

围绕规模化 Token 生产这一目标,商汤大装置形成了「横向编排」与「纵向优化」两条主线,目标是模型质量达标、SLO 达标、有效吞吐提升以及单位产能成本下降。

  • 横向串资源:构建覆盖计算吞吐、KV Cache 容量、有效带宽、模型兼容性的统一资源画像,让不同品牌、不同规格的算力进入同一编排视角;对推理请求进行从准入配对、Prefill 执行、KV Cache 状态交接,到 Decode 接管的全生命周期管控;根据模型、批量、上下文长度的瓶颈变化,动态调整不同芯片的 P/D 角色分工。
  • 纵向拉效率:在模型层做权重量化与显存预算调优,在引擎层针对 Attention、GEMM 等核心算子并行优化,在芯片层做编译、访存调度与内存管理的深度适配,并最终在真实负载中做系统级验证。

技术演进:从动态池化走向模块级拆分

在已有实践基础上,罗伟介绍了商汤大装置在异构协同方向上的两个关键演进方向。

  • 从固定 P/D 到动态资源池:分别构建 Prefill Pool 和 Decode Pool,根据实时负载、KV Cache 状态与节点健康度,动态完成请求路由与 P/D 资源匹配;长输入抬高 Prefill 压力时增加 P 节点,长输出推高 Decode 负载时增加 D 节点,甚至通过角色切换实现 P/D 节点灵活转换。
  • 从 P/D 走向模块级资源池:面向未来多模态与 MoE 模型,将 Encoder、Attention、FFN、视觉编码等模块拆分为独立资源池,各自按负载特点弹性扩缩容,使资源匹配更精准、利用率更高。

演讲最后,罗伟表示,商汤大装置将以「最懂大模型的 AI 基础设施」为目标,持续推动产品与技术迭代,与生态伙伴共同加速 AI 基础设施升级,推动普惠 AI 的落地。

注:本文内容由商汤科技提供,量子位获授权转载。

信源