桃子桃子快讯
返回首页
行业动态

OpenAI 自研芯片实测超越英伟达 Blackwell

SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片「小辣椒」,能效、时延与吞吐均超越英伟达 Black…

2026.08.26 · 周三7 分钟阅读

8 月底,OpenAI 与博通合作研发的首款自研推理芯片「小辣椒」(Jalapeño) 在 Hot Chips 大会上公开亮相,半导体研究机构 SemiAnalysis 受邀到 OpenAI 实验室现场实测。结果显示,这款芯片在能效、时延与吞吐等多项关键指标上均超越了英伟达 Blackwell 系列。这是 OpenAI 自 2024 年年中启动芯片设计以来,首次拿出可与顶级加速卡正面竞争的成果。

跑分碾压:700W 对决 1200W

SemiAnalysis 使用其 InferenceX 基准套件,在 OpenAI 实验室对「小辣椒」进行了现场验证。核心数据如下:

  • 功耗:热设计功耗 (TDP) 仅 700W,显著低于 Blackwell 旗舰加速卡的 1200W–1400W。
  • 能效:每千瓦推理吞吐达到 GB200 NVL72、GB300 NVL72 机架系统的 1.5 到 1.9 倍。
  • 时延:端到端推理时延比 Blackwell 最佳成绩低 1.7 到 3.6 倍,超低时延场景快 2.1 到 4.1 倍。
  • 峰值:在 GB300 最快输出速度设置下,每千瓦吞吐最高超出 8.6 到 104.3 倍。

测试覆盖三个开源大模型——GPT-OSS 120B、DeepSeek R1 670B 与月之暗面 Kimi K2.5(1 万亿参数)。低并发场景下,GPT-OSS 与 Kimi K2.5 达到约 1400 token/秒/用户,DeepSeek R1 在并发 1 时超过 700 token/秒/用户。100 token/秒的低并发点位,Kimi K2.5 上的表现是次优芯片的 9 倍以上。

口径与限制

需要指出的是,以上成绩全部基于单 token 预测 (STP),未启用推测解码或 prefill、decode 分离;而对比的 Blackwell 成绩开启了多 token 预测 (MTP)。若与开启 MTP 的 GB300 比较,峰值能效优势会缩小到约 1.5 倍。

跑分数字由 OpenAI 提供,SemiAnalysis 团队在实验室现场验证了 InferenceX 的跑分过程,但没有运行完整套件,也未测试其更偏好的 AgentX(后者覆盖长上下文多轮对话,更接近真实生产负载)。正确性方面,GSM8k 评测结果与英伟达芯片持平。

此外,SemiAnalysis 认为拿 Blackwell 对比并不完全公平,「小辣椒」真正要对标的是同样采用 HBM4 的下一代英伟达 Vera Rubin。Rubin 系统已开始向客户出货,「小辣椒」目前仅有工程样品。但即便直接对标 Rubin,其单 token 预测每兆瓦输出吞吐也超过了英伟达与 CoreWeave 7 月公布的多 token 预测成绩,每美元产出两者打平。

硬件规格与 AI 参与设计

「小辣椒」的硬件配置同样亮眼:

  • 工艺:台积电 N3P 单计算 die,搭配 N3E I/O chiplet。
  • 算力:单 die 提供 13.4 PFLOPS 的 MXFP4 算力,TDP 仅 700W。
  • 内存:六组 HBM4 高带宽内存,单封装 216GB 容量、15.4TB/s 带宽,为目前已出货或接近出货的加速卡中最高。
  • 进展:2025 年 11 月完成 CoWoS 封装流片,3 个月完成点亮,9 个月拿出 A0 步进成绩;第二版 B0 步进已进厂流片,每瓦性能还可再提升约 25%。

软件层面,芯片内核使用基于 Triton 的 Gluon 语言编写,保留 SPMD 编程模型并暴露更底层抽象。设计阶段 OpenAI 大量使用 Codex、GPT-Astra 辅助,使 SIMD 单元面积缩减 8%,矩阵引擎面积缩减 10%。AI 还自主编写了每个内核,部分块的 AI 内核比人类专家版本快 1.5 到 1.8 倍。迭代速度同样惊人:8 天内并行规模从 TP8 扩到整机架 TP32,不到两周部分交互度下的吞吐翻倍以上。彩蛋是 OpenAI 用 Codex 把《毁灭战士》移植到这颗芯片上,能跑 36 FPS。

讽刺的是,跑在英伟达 GPU 上的 GPT-5 系列模型本身也参与了这款威胁 CUDA 生态护城河的芯片的设计。

量产时间表与系统方案

「小辣椒」目前已就绪工程样品。量产将在 2027 年逐步爬坡,大部分产出集中在 2027 年底,下一阶段目标是 100MW 规模。

承载它的单机架系统名为 Vindaloo,装 128 颗「小辣椒」,搭配 Katsu CPU 主机架和 Chana 交换机架,两个机架合计功耗约 160kW。最多 16 个机架、2048 颗芯片组成一个 scale-up 域。部署将与 neocloud 厂商合作,先收集可靠性数据再逐步放量。

OpenAI 明确表态不会用「小辣椒」替代其现有所有芯片系列,仍将与英伟达的算力伙伴合作训练,但将继续开发第二和第三代芯片。

上市前的隐忧

值得警惕的是,OpenAI 数据中心负责人 Chris Malone 于上周离职,The Wall Street Journal 8 月 25 日率先报道,彭博社随后经 OpenAI 发言人确认。Malone 走后没有指定继任者,职责拆给多位负责人。他 2025 年 3 月加入 OpenAI,正是公司与甲骨文、软银宣布 Stargate 项目之后不久。

Malone 是近四个月来第 4 位离职高管,此前首席营收官 Denise Dresser、首席运营官 Brad Lightcap、CEO 奥特曼的副手 Fidji Simo 都已离开。据 TheNextWeb 统计,4 月以来已有 7 位高层离任或换岗。在 IPO 前夜出现如此密集的高管变动,即使按上市前夜的标准也属罕见。「小辣椒」的技术亮眼,接管它的人却悬而未决。

市场反应

「小辣椒」跑分出炉当天,英伟达股价不跌反涨,单日涨幅约 2.19%。一方面,英伟达同日发布了 Jetson Orin Nano 2 机器人电脑;另一方面,OpenAI 明确不会替代现有芯片,训练仍大量使用英伟达,且双方存在融资担保的合作关系。短期内,「小辣椒」更多是对英伟达推理市场的补充而非替代,真正的对决将在下一代 Vera Rubin 与「小辣椒」B0 步进之间展开。

信源