OpenAI 自研推理芯片 Jalapeño 首测:每瓦性能超英伟达近 2 倍
OpenAI 与博通合作自研的 AI 推理芯片 Jalapeño 在 SemiAnalysis 基准上完成首轮公开测试,…
OpenAI 与博通联合自研的首款 AI 推理芯片 Jalapeño,近日在 SemiAnalysis 发布的公开基准 InferenceX 上完成首轮公开测试。数据显示,Jalapeño 在能效与延迟两端均显著优于英伟达当前旗舰 GB200、GB300,是 OpenAI 摆脱对单一算力供应商依赖的关键一步,也是头部模型公司集体走向自研芯片的标志性事件。
基准成绩:每瓦算力约为英伟达 1.5–1.9 倍
Jalapeño 在 InferenceX 上运行了 GPT-OSS 120B、DeepSeek R1 670B 与 Kimi K2.5 1T 三款主流模型。整体来看,Jalapeño 每瓦完成的 AI 工作量约为英伟达 GB200、GB300 的 1.5–1.9 倍,端到端推理延迟缩短至对照系统的约 30%–60%。
以 DeepSeek R1 为例,一次 8K 输入、1K 输出的推理任务耗时从 5.99 秒降到 1.65 秒,最低 token 间隔由 5.90ms 压到 1.43ms。按这一比例推算,未来 ChatGPT 在调用 Agent 处理复杂任务时,输出速度有望从当前的 1.5 倍「快速」模式,进一步逼近 3 倍速。
架构特点:专为推理打造的协同设计
与定位通用的 GPU 不同,Jalapeño 自设计之初就只承担现代大模型的推理任务。其思路直指大模型推理的两段过程:Prefill 阶段重在计算,Decode 阶段重在反复从内存读取权重和 KV Cache,因而极易撞上「内存墙」。
为化解这一瓶颈,Jalapeño 在架构层面做了三件事:
- HBM4 高带宽内存:配备 216 GiB HBM4,内存带宽达 15.4 TB/s,约为微软 Maia 200 与 Google Ironwood 的两倍;
- 区域化布局:将计算核心与 HBM 划分成多个彼此对应的区域,让权重和 KV Cache 尽量驻留在负责处理它们的本地内存中,跨区域才走专门高速通信网络;
- 计算、内存、网络协同设计:从一开始就将三者并入架构统筹,避免数据在核心、内存与芯片之间无谓搬运。
上述设计带来了显著的能耗优势:Jalapeño 标称功耗 700 W,持续测试功耗低于 550 W,而 GB200、GB300 的标称功耗分别为 1200 W 与 1400 W。换言之,Jalapeño 以英伟达约一半的能耗实现了更高的推理性能,对数据中心而言意味着直接的成本下降。
研发节奏:从启动到流片只用 9 个月
Jalapeño 的研发速度同样罕见。据路透社与 OpenAI 官方博客信息综合:
- 2024 年底至 2025 年初,项目正式立项,初始成员多来自 Google TPU 团队;
- 2025 年 2 月进入正式设计周期;
- 2025 年 11 月完成流片;
- 2026 年 5 月拿到第一块成品芯片;
- 2026 年 8 月完成约 3 个月的芯片上电调试,开启公开测试。
对照 Semiconductor Engineering 给出的行业基准,复杂度相当的 AI 加速芯片从设计到流片通常需 18–24 个月,OpenAI 将正式设计周期压缩到 9 个月,速度近乎翻倍。一个关键加速器正是 AI 本身——OpenAI 的模型直接参与了 Jalapeño 的方案探索、算术电路优化与验证,成品到位后又借助 Codex 与未发布的 Astra 模型,在两个月内完成了 GPT-OSS、DeepSeek R1 与 Kimi K2.5 三款原本不在适配计划内的模型迁移。
行业图景:模型公司集体走向自研芯片
Jalapeño 并非孤例。Google TPU 已经迭代到第八代,并在 2025 年推出首款专用推理的 Ironwood,今年进一步拆分出 TPU 8t 与 TPU 8i;The Information 报道 Google 还在研究代号 Frozen v2 的服务器芯片,尝试把 Gemini 的部分架构固化进硬件。AWS 则有 Inferentia 与 Trainium,Anthropic 通过 Project Rainier 获取近百万颗 Trainium 算力,并已自建团队为下一代 Claude 定制芯片。
驱动这一趋势的直接动力是经济账。OpenAI CFO Sarah Friar 将其战略概括为「以广度建生态,以自营握杠杆」(Build for breadth, own for leverage):训练与通用计算继续采购外部高端系统,稳定且巨量的推理则交给 Jalapeño。第一代芯片产能全部留给 OpenAI 自用,暂不出售或出租。背后逻辑清晰——把推理效率主导权握在手中,结合 ChatGPT 庞大的调用体量,芯片自研的投入可通过运营成本下降较快回收,同时避免对单一供应商的产能与定价形成依赖。
目前 OpenAI 计划在年底前将 Jalapeño 部署到自有算力基础设施,第二代产品已进入研发中段,第三代也已初具雏形。随着第二代、第三代 Jalapeño 以及其他厂商同类芯片陆续问世,AI 加速器的市场格局正在被重新划分。
