OpenAI 为 GPT 5.6 Sol 推出「Ultrafast」极速模式
OpenAI 发布 Ultrafast 模式,基于与 Cerebras 合作将 GPT 5.6 Sol 推理速度提升至…
OpenAI 宣布为其最新旗舰模型 GPT 5.6 Sol 推出名为「Ultrafast」的极速模式。该模式在标准推理速度的基础上提升至 14 倍,每秒可输出最高 750 tokens,面向对响应延迟敏感的企业级工作流。这是 OpenAI 在推理性能优化上的又一次重要尝试,也是其与芯片厂商 Cerebras 合作落地的最新成果。
核心性能与定位
Ultrafast 的核心卖点是「单位时间做更多有用工作」。OpenAI 在官方博文中表示,过去若想获得实时级响应速度,往往需要牺牲模型规模或通用性,转而选用更小或更专门的模型;Ultrafast 则展示了另一条路径——在不显著降级模型能力的前提下压缩响应时间。具体规格方面:
- 推理速度达到标准模式的 14 倍
- 每秒最高输出 750 tokens
- 面向生产环境中的高频、低延迟场景
OpenAI 将这一能力定位为提升 GPT 5.6 Sol 在企业级部署中的可用性,而非简单的「快一点点」。
与 Cerebras 的硬件合作
极速模式的背后是 OpenAI 与芯片厂商 Cerebras 的合作。Cerebras 长期专注于大模型推理加速硬件,其晶圆级引擎(WSE)在低延迟推理场景中具有较强竞争力。此次合作意味着 OpenAI 在 GPU 之外的推理算力布局进一步落地,也体现了头部模型厂商在「延迟与吞吐」维度上的差异化竞争正在加剧。
目标场景与竞争对比
OpenAI 列出的重点应用场景包括:
- 事件响应(incident response)
- 客服与技术支持
- 金融市场分析
- 电商等高频交互业务
这些场景的共同特征是「延迟即业务价值」——响应快慢直接影响用户体验或决策时效。竞争对手方面,Anthropic 也为 Claude 提供了快速模式(fast mode),但 OpenAI 表示其速度规格目前高于 Claude 的同类选项。
开放节奏
Ultrafast 目前以预览版形式开放,仅向一小部分客户开放测试。OpenAI 表示将随产能(capacity)逐步扩大可用范围,普通开发者和企业用户暂未获得广泛访问权限。更多关于定价、配额以及正式 GA 时间的信息,OpenAI 尚未披露,后续值得持续关注。
