桃子桃子快讯
返回首页
产品功能

OpenAI 推出 GPT-5.6 Sol 极速模式,速度提升 14 倍

OpenAI 为 GPT-5.6 Sol 上线 Ultrafast 极速档位,速度达每秒 750 token,依托 Ce…

2026.08.14 · 周五5 分钟阅读

OpenAI 近日为 GPT-5.6 Sol 推出了名为 Ultrafast 的新档位预览版,处理速度最高可达标准模式的 14 倍,每秒输出约 750 个 token,且模型本身的智能水平并未打折。同日,ChatGPT 桌面版上线了 Computer History 记忆功能,可记录用户在本机上的点击、键入与应用切换等交互事件,便于在多轮工作中无缝衔接。

Ultrafast:极速档位,不以智能换速度

GPT-5.6 Sol 在 Ultrafast 模式下被定位为「对延迟极其敏感」场景的实时助手。OpenAI 给出的典型用例包括:系统报警时同步读日志并比对近期代码改动、市场信号跳动时实时分析异常交易、用户在购物车前犹豫时立即回答产品问题并给出推荐。早期用户反馈积极,例如金融研究 AI 公司 Rogo 的应用 AI 负责人 Alex Wang 表示「感觉像是在跟一个人实时对话」;AI 客服平台 Podium 的语音 AI 产品负责人 Courtland Lykins 则认为,它让客服在处理棘手问题时不再被模型响应拖慢节奏。

值得注意的是,Ultrafast 跑的依然是最高档的 GPT-5.6 Sol,并非用更小参数的模型做能力置换,速度提升完全来自硬件与调度方式的优化。

硬件底座:Cerebras 晶圆级引擎

Ultrafast 的速度由 Cerebras 的晶圆级推理芯片支撑。GPT-5.6 Sol 的模型权重被直接放进芯片上 44GB 的 SRAM 中,跳过了传统 GPU 需要在显存与计算单元之间反复搬运数据的环节,绕开了长期制约推理速度的显存带宽瓶颈。

OpenAI 与 Cerebras 的合作早有铺垫:两家于今年年初签署了多年协议,计划部署 750MW 规模的晶圆级系统,协议总值超过 100 亿美元。Ultrafast 可被视为这份战略协议在产品层面的一次具体落地。

Computer History:让 ChatGPT 看见你的工作流

Computer History 是 ChatGPT 桌面版记忆系统的一次扩展。在原有 Memories(记录用户在对话中主动告知的内容)之外,Computer History 增加了一条新的输入源,覆盖点击、打字、快捷键、应用切换等交互事件,但不会截屏、录音或采集系统音频。该功能脱胎于今年 4 月上线的研究预览版 Chronicle,可视为其重构版本。

用户可以直接以日程式口吻向 ChatGPT 提问,例如「我上次休息前在做什么」「我今天早些时候找的那份提案文档在哪」「帮我列一下今天做过的任务和进度」。历史记录页按天与时间分组展示,每条记录附带摘要与参与的应用,可一键在 Finder 中定位对应记忆文件或直接删除。对于重复出现的工作流程,ChatGPT 还会主动询问是否存为可调用的 skill;用户也可在菜单栏或设置里随时暂停收集,或将特定应用与网站排除在外。

数据处理方面,Computer History 保持克制:临时事件文件在本地最多保留 48 小时,OpenAI 服务器完成处理后不保留原始事件,也不会用于模型训练,最终生成的记忆以 Markdown 文本形式保存在本地。

推理速度:从加分项变成标配

过去半年,头部模型厂商几乎同时把「更快」做成独立产品线。Anthropic 于今年 5 月上线 Fast Mode,在结构清晰的提示词下将响应时间中位数从 2.8 秒压至 1.2 秒;Google 为实时交互场景准备了 Gemini Flash Live;xAI 为 Grok 单独开设了 fast 端点。芯片层面,Cerebras 在中小模型上可达每秒 3000 个 token,Groq 强项是稳定低延迟,SambaNova 则在高并发场景下以总吞吐量见长。国内厂商同样在卷速度:字节跳动豆包系列依托火山引擎推理基础设施主打低延迟,阿里 Qwen-Turbo 自定位为超快、超长上下文、低成本的高并发模型;小米 MiMo-V2.5-Pro-UltraSpeed 通过 FP4 量化与投机解码在普通 8 卡 GPU 上将万亿参数模型的生成速度推到每秒 1000 个 token 以上;月之暗面 Kimi K3 采用 KDA 混合线性注意力架构,解码速度号称比常规架构快 6.3 倍。可以预见,推理速度的竞赛仍将持续,Ultrafast 的出现只是其中一个节点。

信源