产品功能
OpenAI 升级 GPT-Live:语音交互实现边说边听
OpenAI 宣布 GPT-Live 语音架构重构,实现边说边听,推理与工具调用不再打断对话。
2026.08.04 · 周二约 2 分钟阅读
OpenAI 近日通过官方 X 账号宣布,旗下语音对话功能 GPT-Live 实现了边说边听的能力。为让这种交互方式在 ChatGPT 的规模下足够自然,团队对语音技术栈进行了从客户端到模型的全面重构。
全新的语音架构
据 OpenAI 介绍,新架构的核心变化在于音频流的处理方式——改为持续流动模式(continuously)。这意味着模型在输出语音的同时,仍能持续接收并处理用户的语音输入,打破了此前语音对话中轮流说话的局限。从技术描述来看,这一改造覆盖了客户端与模型两端,属于端到端的重新设计,而非局部修补。
推理与工具调用不再打断对话
此前,当 ChatGPT 进行较深度的推理或调用外部工具时,语音交互往往会出现明显的卡顿或中断。新架构通过保持音频流的连续传输,让这类后台处理与语音输出能够并行进行——用户在模型思考期间仍可继续提问,模型也能在处理完推理后无缝衔接回复,使整体对话节奏更接近人与人之间的自然交流。
为规模化而重建
OpenAI 在消息中特别强调,此次重构是为 ChatGPT 规模(ChatGPT scale)而设计,即在海量并发请求下仍能保持流畅的语音体验。重构范围横跨客户端与模型两端,涉及推理框架、音频编解码与流式传输协议等多个层面的协同优化。官方还在原帖中附带了一段介绍视频,用于展示实际交互效果。
截至目前,OpenAI 未披露具体的延迟指标、模型参数变化或上线时间等细节,更多技术信息有待后续公开。
