桃子桃子快讯
返回首页
行业动态

英伟达 Vera Rubin 首测:智能体任务每兆瓦吞吐暴涨 30 倍

英伟达公布 Vera Rubin NVL72 首次实测,较 GB300 每兆瓦吞吐最高提升 30 倍、Token 成本最…

2026.08.25 · 周二5 分钟阅读

在 Hot Chips 2026 大会上,英伟达首次公开下一代旗舰机柜 Vera Rubin NVL72 的片上实测数据。测试直接采用开源大模型 DeepSeek-V4-Pro(1.6T 参数),在 SemiAnalysis 旗下的 AgentX 智能体编码基准上完成。结果显示:相较当前主力 GB300 NVL72,Vera Rubin 的每兆瓦吞吐量最高提升 30 倍,每百万 Token 的生产成本最高下降 35 倍。这是英伟达首次以「完整 Agent 工作流」而非单次推理请求来衡量硬件性能,被官方视为 AI 基准测试范式的转向。

核心数据:从 H200 到 Vera Rubin 的 900 倍跃迁

英伟达给出的对照曲线呈现出一条陡峭上升的帕累托前沿:

  • H200 → GB300:在真实 Agent 工作负载下,每兆瓦吞吐量提升约 15 倍,整机架价格大致翻倍。
  • GB300 → Vera Rubin:每兆瓦吞吐量再提升最高 30 倍,整机架价格再翻倍。
  • 两年累计:整机架价格上涨约 4 倍,吞吐量提升达到约 900 倍。

Vera Rubin 还搭配 NVIDIA DSX MaxLPS 电源管理技术,可在相同兆瓦预算内多配置最高 40% 的 GPU,进一步压缩单位算力成本。对受电力供给约束的「AI 工厂」而言,同等电力预算下可承载 30 倍的智能体任务量。

技术拆解:协同设计而非单芯片工艺

Vera Rubin 的性能跃升并不依赖单颗 GPU 制程,而是整套系统级协同:

  • 分离式服务与分布式 KV 缓存,配合 KV 感知路由,最大限度复用长上下文状态。
  • NVFP4 量化将模型权重压缩至 4 位精度,内存占用显著下降。
  • 第六代 NVLink 针对 MoE 架构优化,提供比传统以太网快 10 倍、延迟低 3 倍的互联,使 72 颗 GPU 之间可无缝调度不同「专家」子网络。

英伟达官方表示,传统的 8K/1K 固定长度基准已无法刻画 Agent 场景下的真实开销——OpenRouter 数据显示,单次 Agent 任务的 Token 消耗约为普通对话的 15 倍,工具调用与子智能体的递归推理放大了长上下文处理压力,这也是 H200 在新基准下显得力不从心的根本原因。

Groq 3 LPX 量产:3400 Token/秒重写解码延迟

与 Vera Rubin 同台亮相的 Groq 3 LPX 是 Vera Rubin 平台的专属低延迟推理加速器,来自英伟达 2024 年 12 月以约 200 亿美元收购的 Groq 团队。其设计思路是将「读」与「写」分离:Rubin GPU 负责大规模上下文处理,Groq 3 LPX 负责极速 Token 生成。机架级部署中,最多 256 颗 LP30 加速器可通过超高带宽互连与 GPU 协同。

关键实测数据:

  • 在 Artificial Analysis 基准下,Groq 3 LPX 搭载 Gemma 4 31B、10 万 Token 超长上下文窗口,输出速度达到 3,400 Token/秒。
  • 生成 5,000 Token 的耗时从 50 秒压缩至 1.5 秒,差距达 34 倍。
  • 编码任务峰值输出 6,981 Token/秒,延迟敏感型工作负载较竞品快 4 倍。

Nebius 已在自家 Token Factory 中部署该芯片,为智能体循环的每一步提供即时响应。

Vera CPU:首款专为 Agent 设计的 88 核处理器

同日发布的 Vera CPU 被英伟达定位为「首款 Agent 专属 CPU」:

  • 88 颗自研 Olympus 核心。
  • 高带宽 LPDDR5X 内存,带宽达 1.2 TB/s。

英伟达在 Hot Chips 现场强调,Agentic AI 是「史上最复杂的计算任务」——一次任务背后往往包含上百次工具调用、Python 执行、上下文检索与子智能体协作,调度压力几乎全部压在 CPU 上。马斯克的 SpaceXAI 已宣布规模化部署 Vera CPU,并将基于 Vera Rubin 平台建设吉瓦级算力工厂驱动 Groq;双方还设计了一款优化版 Vera Rubin NVL72,计划于 2028 年大规模部署,并随「Starmind」AI 卫星进入太空。

从 GPU 到「AI 工厂」:英伟达的版图扩张

一天之内,Vera Rubin GPU、Vera CPU、Groq 3 LPX 三条产品线齐发,标志着英伟达的产品边界已从单一 GPU 扩展至覆盖训练、推理加速、CPU 与高速互联的完整系统。英伟达对外传递的信号清晰:在 Agent 时代,卖的不再是一块显卡,而是一座「持续生产 Token 的 AI 发电厂」。

信源