桃子桃子快讯
返回首页
行业动态

OpenAI 自研芯片首测:功耗不到对手一半,性能反超 GB300

OpenAI 公布自研推理芯片 Jalapeño 实测数据,在 GPT-OSS、DeepSeek R1、Kimi K2.…

2026.08.26 · 周三5 分钟阅读

OpenAI 正式公布了其首款自研推理芯片 Jalapeño 的实测数据。在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款主流大模型上,这款芯片以不到英伟达 GB300 一半的持续功耗,在峰值吞吐量、端到端延迟等关键指标上实现了反超。配合公司首次披露的「AI 全流程造芯」方法论,这一结果被业内视为对英伟达 CUDA 护城河的一次正面冲击。

性能实测:550W 对 1400W

Jalapeño 额定功耗 700W,实测持续功耗不超过 550W;作为对比,英伟达 GB200 的 TDP 为 1200W,GB300 高达 1400W。OpenAI 采用 SemiAnalysis 发布的 InferenceX 基准测试工具,统一在 8K 输入、1K 输出、单 token 预测的口径下进行对比。

核心结果如下:

  • 峰值每瓦吞吐量方面,三款模型分别达到对比系统的 1.5 至 1.9 倍;
  • 端到端延迟领先 1.7 至 3.6 倍。

具体到模型:

  • GPT-OSS 120B(对比 GB200):Jalapeño 最高每千瓦处理约 8.54 万 token/秒,约为 GB200 的 1.9 倍;单用户生成速度可达每秒 1459 token,对比系统约 535 token。
  • DeepSeek R1 670B(对比 GB300):峰值每千瓦吞吐量约 1.96 万 token/秒,对比系统约 1.18 万;低延迟下单用户生成速度最高约 700 token/秒,对比系统约 169 token/秒,差距约 4.1 倍。
  • Kimi K2.5 1T(对比 GB300):峰值每千瓦吞吐量约 1.82 万 token/秒,对比系统约 1.19 万;最低端到端延迟 1.56 秒,对比系统 5.31 秒。

在「等速对比」口径下,差距进一步放大:以 DeepSeek R1 为例,双方维持约 169 token/秒的单用户生成速度时,Jalapeño 每千瓦处理约 1.23 万 token/秒,GB300 仅约 118 token/秒,相差约 104 倍;GPT-OSS 和 Kimi K2.5 的同类差距分别约为 53.7 倍和 56.1 倍。

架构设计:HBM4 切片与极简内存路径

Jalapeño 采用单块 Compute Die 加 6 颗 HBM4 与独立 I/O Chiplet 的组合结构。其关键创新在于把计算核心与 HBM4 切成对应切片,每个核心只直连本地 HBM,走极简的低延迟路径;切片之间通过专用高带宽网络同步。这一设计大幅削减了内存子系统的固定开销,使芯片即使在处理小批量、需要极快响应的推理任务时,也能逼近理论峰值带宽。

AI 造芯流水线:从电路到算子的全流程自动化

OpenAI 用公司内部代号 Astra 的 GPT-6 旗舰模型与增强版 Codex,把芯片研发拆为三层流水线:

  • 硬件设计层:AI 用于探索实现方案、缩短验证周期,并直接优化芯片内部的算术电路,使核心计算面积显著缩减;硬件从立项到流片仅用 9 个月。
  • 软件编译层:底层算子接近汇编级调优,部分单个算子代码达 3000 行;OpenAI 让 Codex 自动寻找更优算子实现。在适配 DeepSeek R1 时,团队甚至在缺少 MLA 算子实现的情况下,由 Codex 几乎独立完成了高效实现。在 GPT-OSS 的部分注意力和 MoE 模块中,AI 生成的代码比此前人工版本快 1.5 至 1.8 倍。
  • 模型移植层:OpenAI 自研了编程语言与编译引擎,将芯片设计成对人类与 AI 都清晰、可预测的编程目标,彻底绕开 CUDA 生态,让 AI 直接把高层算法翻译成硬件配置。

SemiAnalysis 因此判断:「考虑到 OpenAI 能在自家芯片上如此快速地适配新模型,CUDA 的护城河岌岌可危。」更具反讽意味的是,跑在英伟达 GPU 上的 GPT 模型,正被 OpenAI 用来设计挑战 CUDA 的芯片。

算力博弈进入新阶段

算力供给正成为大模型演进的生死线。腾讯云 CEO 汤道生在近期内部长文中直言腾讯整体算力「严重不足」,已拖慢混元模型训练与产品迭代。从 Anthropic 与三星讨论定制芯片,到 DeepSeek、智谱等公司推进算力闭环,模型公司亲自下场造芯已从技术试水升级为核心战略。

OpenAI 此次披露的 Jalapeño 数据与 AI 造芯方法论,意味着芯片设计的迭代节奏被根本性改写。随着更多模型被适配,这套自研软件栈和编译引擎将形成正向飞轮,其优化速度只会越来越快。英伟达引以为傲的 CUDA 生态,正迎来 AI 编程层面的正面挑战。

信源