产品功能
Google 推出 Gemini 3.5 转写模型,支持 85 种语言自动识别专业术语
Google 更新 Gemini Audio,发布 3.5 Live、3.5 Live Experimental 及全新…
2026.08.27 · 周四约 2 分钟阅读
Google 近日更新了 Gemini Audio,推出 Gemini 3.5 Live、3.5 Live Experimental 以及全新成员 Gemini 3.5 Transcribe 三款音频模型,重点强化语音转写能力。新版本在精度与抗干扰方面做了改进,旨在为 Google 语音控制类 AI 功能提供更可靠的底层支持。
核心能力升级
Gemini 3.5 Transcribe 是本次新加入的模型,专门面向高精度转写场景。据 Google 介绍,新模型具备以下能力:
- 自动识别并正确转写专业术语与行业 jargon;
- 支持超过 85 种语言的转写;
- 在背景噪音或语音被打断的情况下,仍能保持转写稳定。
配套发布的 Gemini 3.5 Live 与 3.5 Live Experimental 则面向实时语音交互场景,进一步提升对话流畅度与抗噪表现。
缺席的 Gemini 3.5 Pro
值得注意的是,Gemini 3.5 Transcribe 的发布恰逢外界持续关注 Gemini 3.5 Pro 的进度。Google 此前承诺该模型将在 6 月推出,但截至目前仍未正式发布。Google 选择先以转写与语音模型扩充产品线,被视为在主力大模型空窗期保持 Gemini 生态活跃度的策略。
对开发者的意义
对于依赖 Google 语音 AI 的开发者与产品团队而言,新模型提供了更细粒度的选择:实时对话可用 3.5 Live 系列,批量化或高精度转写则可调用 3.5 Transcribe。多语言与术语识别能力的提升,也使其在会议记录、客服质检、媒体字幕等场景下具备更直接的落地价值。
