桃子桃子快讯
返回首页
产品功能

OpenAI 推出 GPT-Live-1 API,正式开放全双工语音能力

OpenAI 上线 GPT-Live-1,将 ChatGPT 的全双工语音对话能力开放至 API,开发者可构建可控的语音…

2026.09.11 · 周五3 分钟阅读

OpenAI 近日在 API 及 OpenAI Platform 中正式上线 GPT-Live-1,将原本内置于 ChatGPT 的全双工语音对话能力以 API 形式开放给开发者。据 OpenAI 联合创始人 Greg Brockman 在 X 平台披露,该模型面向「为构建者赋能」的场景设计,旨在支持开发者打造新形态的语音应用与工作流。

核心能力:全双工语音对话走向可控化

GPT-Live-1 最核心的特性是把 ChatGPT 的自然全双工(full-duplex)对话体验搬到了 API 层,并赋予开发者更细粒度的控制权:

  • 支持双向、实时的语音交互,语音智能体可边听边说,不再是传统的「一问一答」轮次;
  • 提供对语音智能体「如何说话、如何行动」的更多控制接口,便于按业务场景定制语气、节奏与行为策略;
  • 支持在语音流程中将任务委派给其他模型,构建由多个模型协作的语音工作流。

这意味着此前需要自行拼接 ASR(自动语音识别)+ 大模型 + TTS(语音合成)三段链路的语音产品,可以用单一接口获得接近 ChatGPT 高级语音模式的体验。

上线方式与平台入口

根据 TestingCatalog 在 X 上的报道,GPT-Live-1 已同时出现在 API 和 OpenAI Platform 控制台中,开发者可以直接在 Playground 中试用,并通过 API 集成到自有应用。OpenAI 官方对该能力的定位强调「为构建者赋能」,暗示后续将围绕该模型推出更多面向开发者的配套工具与文档。

对开发者生态的影响

GPT-Live-1 的开放,意味着语音智能体(voice agent)开发的门槛进一步降低:

  • 客服、虚拟助手、有声交互等场景的团队可以直接调用全双工语音能力,无需自行维护语音流水线;
  • 「语音 + 任务委派」组合让构建多模型协作的复杂语音工作流成为可能,例如语音入口 + 专用模型处理垂直任务;
  • 与此前第三方提供的实时语音方案相比,OpenAI 官方 API 在稳定性与一致性上更具优势,可能引发语音 AI 应用的新一轮迭代。

尚待补充的信息

截至目前,公开渠道尚未披露 GPT-Live-1 的具体定价、延迟、支持的语种与配额限制等关键参数,也未公布与此前 Realtime API 的功能差异。开发者如需评估接入成本和性能,仍需等待 OpenAI 官方文档的进一步更新。

信源