agent 时代,算力账本要重写
平头哥算力峰会上,阿里披露倚天CPU路线图与磐脉920网卡,强调在agent场景下CPU与网络已承担过半负载与性能,AI…
在阿里旗下芯片公司平头哥举办的算力峰会上,两场相隔的演讲——一场讲 CPU,一场讲网卡——共同指向同一个结论:进入 agent 时代,AI 请求的耗时和性能不再只由显卡决定,CPU、内存与网络正在成为新的关键路径。云栖主论坛次日,平头哥首次公布倚天 CPU 路线图:2027 年推出倚天 720 和 730,后续为 750,搭配第二代自研核与片间互联,可直连真武 AI 芯片;磐脉 920 网卡则随灵骏真武 M890 超节点同步上线。两份「说明书」一明一暗,把行业里那条被 GPU 遮住的算力账本摆到了台面。
CPU 回到关键路径
平头哥半导体产品总监黄伟给出的一组现场数字是这场演讲的底色:
- 通用 agent 场景中,工具执行一项约占整次请求响应时间的 60%
- 编码 agent 场景中,容器初始化加工具执行在 CPU 侧占比 55%–60%
- 单次迭代任务里,约 41% 的工作无法靠并行摊掉,属串行段
- 单个 agent 实例峰值内存需求约 28GB
围绕这些数字,黄伟把 CPU 的活拆成两类。
机头:贴着 GPU 干杂事
机头(head node)负责预处理、KV cache 管理、加速器调度与结果回收,整条链路卡在关键路径上——机头慢一步,GPU 就空等一步。围绕机头,平头哥在单核性能上做了多项取舍:拓宽前端、乱序窗口放大、KV cache 页表预取、内存重命名、用软件逐条削减 Python 解释器开销,并将 KV cache 元数据在三级缓存与内存间分层摆放,目标只有一个——让 GPU 别等该到手边的笔记。
机房:几百个 agent 挤一柜
机柜里塞进几百个沙箱,每个沙箱一个 agent,全程不碰 GPU,瓶颈从单核速度变成并发与容量。针对不规则跳转,平头哥引入神经分支预测;针对 RAG 与图遍历,引入图预取;针对共享缓存抢食,使用动态缓存替换;针对相互挤占,引入 MPAM 给每个沙箱定配额。一句话:机头看的是搬得快不快,机房看的是装得多不多。
网卡决定推理性能
阿里云智能集团高性能网络研发负责人付斌章先用一张成本表破题:网卡在集群成本中占比不到 20%,有的甚至只有一成,但推理阶段过半的性能由通信决定。他把当前网络的三件麻烦逐一摊开。
混跑:训练推理互相踩踏
训练流量像匀速大货车,推理流量像频繁变道的轿车;推理一来,训练整队降速。这要求网络必须能识别流量并隔离拥塞。
长距:PD 分离后的跨城代价
推理流行 Prefill-Decode 分离后,两段 GPU 不在同一机柜,数据就要跨广域网:机房内一次往返约 100 微秒,跨城 5–10 毫秒,相差两个数量级;探路回报慢,传输吞吐跟着塌。
弹性:短命容器等不起专线
agent 容器秒级拉起、干完就销毁,而 RDMA 需要提前铺好资源与地址,对几十秒生命的容器不友好,许多场景被迫退回 TCP。
针对这三件麻烦,阿里把网络拆成三张:训练走 HPN(高性能网络),8.0 版用 102.4T 交换芯片,在研 9.0 上 200T,两层网络可挂数十万个 800G 端口;推理走 TPN(按 token 性能设计的网络),打通了机头网络与机尾网络,让同一集群内不同 pod 可以不出机房互相喂数据,省掉长距传输;超节点内部走 UPN(超节点网络),采用光互联,物理上不必绑死,单层可铺千卡。跨集群则走骨干网里的智算专线 ECORE,带宽比普通骨干高一个数量级并全程支持 RDMA。
主角:磐脉 920
磐脉 920 是这场演讲的落点。它的关键规格与设计包括:
- 带宽 400G,每秒可通过约 4000 亿比特数据
- 内置交换机模块,跨平台插卡均可输出 GPU 直读网卡的性能
- 同时支持 RoCEv2 标准协议与阿里自研 SolarRDMA,按连接逐条自动选路,新卡走自研、遇老卡回落标准协议
- 支持「以太网+」协议,小包传输有效载荷占比达 85.4%,号称业界最高
付斌章现场公布四张成绩单(均为现场披露口径):
- 千卡任务实测:通信耗时降 43.2%,端到端性能提升 12%
- 跨集群长距:端到端吞吐提升 55%
- 弹性:连接密度为传统虚拟化的 64 倍,容器拉起时间最少省 35%、最多省 93.4%
- 弹性不拿性能换:套虚拟化后通信速度与硬件直通几乎一致
他强调,磐脉 920 已随灵骏真武 M890 超节点上线,老集群可逐张替换而不中断业务。
从拼卡数到算时间花在哪
把两场演讲放在一起看,黄伟说「CPU 扛起过半负载」,付斌章说「通信决定过半性能」——口径不同,一个量时间、一个量性能,但指向一致:请求进来之后,GPU 出力的那段在整条路上越来越不稀罕,剩下的大头落在 CPU、内存、网络上。串场主持人的总结被作者记下:「人工智能的竞技场,已经从参数规模角逐,转向工程落地的深水区,单点的突破撑不起智能体时代的系统级负载。」
过去聊算力,先问有几张卡;往后可能要问——一次请求进来,时间花在哪了,带宽堵在哪了,内存够谁用。卡多不等于活好,这个账,行业刚开始认真算。
