桃子桃子快讯
返回首页
产品功能

ChatGPT 桌面端上线语音指挥,可同时调度多个智能体

OpenAI 把语音搬进桌面版 ChatGPT,可语音启动任务、追踪进度并协调多个智能体。

2026.07.27 · 周一4 分钟阅读

OpenAI 正在把 ChatGPT 桌面端从「聊天窗口」变成「能用嘴指挥的工作台」。7 月 23 日,公司将 ChatGPT Voice 正式引入桌面版 App 的 Work 与 Codex 场景,并在 macOS 与 Windows 上向 Plus、Pro、Business、Edu、Enterprise 全档用户分批推送;Android 即将跟进,iOS 则通过 Remote 配对远程接入。这套语音能力由 7 月 8 日上线的新一代语音模型 GPT-Live 提供支持,可同时听与说、支持随时打断,并把重负载的推理甩给后台模型处理。

桌面端语音能做什么

此次更新的重点并非「终于能开口聊天」,而是把语音变成任务调度入口。在 Work 与 Codex 场景中,用户可以张嘴启动任务、查询进度、查看智能体状态,或在同一段对话里同时协调多个 Agent,让它们各自分工;任务在后台运行期间,用户可以随时插话改变方向,卡住或完成时 AI 会主动用语音或在屏幕上给出提示。

它还能「接着干」上一轮的活儿:通过项目上下文接入已有文档、日历、联系人和通讯记录,把一件做了一半的事情收尾。官方给出的生活化例子包括查询日历冲突、查看航班是否改期、提前备好会议纪要,让这些事情「在你泡咖啡时」由后台跑完。macOS 还新增 Appshots 与屏幕上下文功能,可直接读取当前最前方的窗口,结合本地文件与代码库理解任务,热键也支持自定义。

OpenAI 同时披露,Codex 与 ChatGPT Work 的周活用户已突破 1000 万。

底层是新一代语音模型 GPT-Live

支撑桌面端语音体验的,是 7 月 8 日上线的 GPT-Live。它打破了传统「先录音、再转文字、最后回一句」的单回合模式,能够边听边说、对用户的打断即时响应。后端推理由 GPT-5.5、GPT-5.6 等模型承担,前端只负责把对话流畅地接住——这种前后端解耦,正是为了让用户可以「随意开口」。

社区测试显示,语音吞吐约为每分钟 240 个词,而键盘打字通常只有 70 到 80 个词,差距达到三四倍。语音让一次性倒给 AI 的上下文带宽显著扩大。

业界不约而同押注语音

OpenAI 并非孤例。过去一周内,Andrej Karpathy、马斯克、Sam Altman 三位行业人物在公开场合不约而同地强调了语音的价值。Karpathy 在 X 上表示,当上下文太多、又懒得打字时,他会直接切换到语音「意识流开聊」,让模型把那团乱麻重新捋顺。马斯克转发了相关讨论,并补充称用户已经可以像跟人说话一样,通过 Grok Build 把任务交给 Grok 去执行。Altman 则承认自己一向更爱打字,但现在和 ChatGPT「说的比打的多了」,并指出需要一次性倾倒大量上下文时,语音尤为合适。

他们共同看中的并非「解放双手」本身,而是语音作为一种高带宽输入通道,能让人把脑里那些并行、跳跃、不成句的想法一次性交给 AI,再由模型整理成可执行的意图。

从「聊天工具」到「AI 工作操作系统」

把语音、Work、Codex 一并放入桌面端入口,背后是一条更长的路线:OpenAI 希望 ChatGPT 承担「AI 工作操作系统」的角色。Codex 早已扩成可并行多个智能体、跑长任务、读懂整个项目的通用平台;现在语音又让用户可以像「带团队的经理」那样,分派任务、调整优先级、在多个项目间切换。

把能力放在桌面而非手机,原因在于手机那块小聊天框干不了复杂活儿。桌面才有文件、IDE、浏览器以及完整的企业办公软件,这才是智能体能「干活」的主战场。当输入不再成为瓶颈,人可以把省下来的脑力还给真正值得琢磨的事:决策。至于「你到底想让一屋子随叫随到的 AI 替你做什么」,才是下一步的问题。

信源