OpenAI 首款自研推理芯片 Jalapeño 测试结果出炉
OpenAI 公布自研推理芯片 Jalapeño 首批测试数据,在 GPT-OSS 120B、DeepSeek R1、K…
OpenAI 近日公布了其首款自研推理芯片 Jalapeño 的首批测试结果。在多款主流大语言模型的推理基准测试中,这款专为推理阶段优化的芯片在每瓦吞吐量与端到端延迟等关键指标上,均优于英伟达 GB200 与 GB300 系统。OpenAI CEO Sam Altman 也在社交平台 X 上发文确认:「我们制造了一款芯片,它的速度很快。」
值得注意的是,Jalapeño 是 OpenAI 与 AI 芯片公司 Cerebras 合作推出的产品,定位是为模型部署后的推理阶段服务,而非用于训练下一代 GPT 模型。OpenAI 强调,未来仍将继续大规模部署英伟达及其他合作伙伴的加速器。
性能表现:兼顾高吞吐与低延迟
传统推理硬件往往需要在「吞吐量」与「延迟」之间取舍:大规模批处理可提升整体效率,但单次请求等待时间会变长;追求极低延迟又会牺牲资源利用率。OpenAI 表示,Jalapeño 通过全新架构设计,在同一套系统中同时优化了两者。
测试覆盖三款公开模型:GPT-OSS 120B、DeepSeek R1 670B 与 Moonshot AI 的 Kimi K2.5 1T。结果显示:
- 峰值吞吐量下,每瓦 AI 工作量达到对比系统的 1.5 至 1.9 倍;
- 端到端延迟降低至对比系统的 1/1.7 至 1/3.6;
- 在高度交互式工作负载下,性能优势达到 2.1 至 4.1 倍。
以 Kimi K2.5 1T 为例,Jalapeño 峰值每瓦性能约提升 1.5 倍,端到端延迟降低约 3.4 倍;在相同解码速度下,每瓦吞吐量优势从峰值的 1.5 倍最高扩大至 56.1 倍。
在 DeepSeek R1 670B 上,Jalapeño 峰值每瓦吞吐量约为 GB300 的 1.7 倍;在该对比系统最佳 token-between-token(TBT)条件下,每千瓦吞吐量达到 12,258 mixed TPS/kW,相比 GB300 的 118 高出约 104.3 倍。
Jalapeño 额定功耗为 700W,但实际持续功耗始终保持在 550W 以下。OpenAI 采用 SemiAnalysis 的 InferenceX 公开基准进行测试,结果显示其在每瓦吞吐与延迟组合上处于 Pareto frontier(帕累托前沿)。
为 Agent 而生,AI 参与芯片设计
Jalapeño 从一开始就围绕交互式 Agent 场景设计。Agent 需要连续完成多个步骤,单次请求的延迟会在整个任务中不断累积,因此低延迟区间的优化尤为关键。
OpenAI 采用芯片、内存、网络、软件与机架级系统的协同设计:通过将 KV Cache 等模型状态尽可能保留在本地,Jalapeño 可同时适配 Prefill 与 Decode 两个阶段,并随工作量变化灵活调整。
更引人关注的是,AI 本身也参与了 Jalapeño 的开发:
- 从最初设计到 Tape-out(流片定稿),OpenAI 团队仅用了 9 个月;
- 使用 GPT-Astra 驱动的 Codex,仅用 2 个月就让三款原本不在生产计划中的开放权重模型实现了高性能运行;
- 在部分 GPT-OSS 的 Attention 与 MoE 模块中,Codex 生成的实现比原有人类专家手写版本快 1.5 至 1.8 倍。
部署计划与下一代路线
OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自有计算基础设施中,目前团队仍在进行生产验证与软件完善。后续产品也已启动:Gen 2 进入深度开发阶段,Gen 3 也在规划之中。
OpenAI 将 Jalapeño 带来的效率提升总结为三档:
- Ultra-fast 模式:达到过去 Fast 模式才有的效率;
- Fast 模式:达到过去 Batch 模式才有的效率;
- Batch 模式:效率进一步提升。
Jalapeño 的推出,标志着 OpenAI 在「模型 — 软件 — 芯片 — 数据中心」全链路上迈出关键一步。在英伟达通用 GPU 之外,越来越多头部 AI 公司开始自研专用加速器,包括 Google TPU、Amazon Trainium/Inferentia、Microsoft Maia、Meta 自研 AI 加速器等,核心逻辑都在于为自身工作负载打造更具性价比的算力底座。
