桃子桃子快讯
返回首页
模型发布

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型

Google DeepMind 发布最新语音转文本模型 Gemini 3.5 Transcribe,主打精准与智能转写能…

2026.08.27 · 周四2 分钟阅读

Google DeepMind 在其官方 X 账号上宣布推出 Gemini 3.5 Transcribe,称其为旗下最新的语音转文本(speech-to-text)模型,强调「精准」与「智能」转写能力。原帖以一条简短预告(带 🧵 线程标记)的形式发布,暗示后续将补充更多细节,但截至本文整理时,官方尚未披露该模型的完整技术规格、定价、上线渠道以及与前代或竞品的能力对比。

发布背景与定位

Gemini 系列此前已涵盖文本、图像、视频等多模态能力,Gemini 3.5 Transcribe 的加入意味着 Google DeepMind 将语音识别纳入 Gemini 主线产品矩阵。官方将其定位为「精准且智能」的转写工具,但未具体说明「智能」所指——是更强的标点还原、说话人分离,还是对领域术语、口音、噪音的鲁棒性提升,仍有待官方进一步说明。

已知信息与待补细节

从当前可获取的信息来看,Gemini 3.5 Transcribe 的核心卖点集中在以下两点:

  • 精准转写:延续 Gemini 系列对低错误率的追求,具体基准测试(WER 等)尚未公布。
  • 智能处理:可能涉及上下文理解、语义分段或自动格式化等增强能力,细节待官方披露。

以下关键信息目前仍为空白:

  • 模型参数规模与架构(是否为端到端大模型,或基于传统 ASR 管线)。
  • 支持的语种数量与音频长度上限。
  • API 定价与是否对企业客户开放。
  • 与 Whisper、ElevenLabs 等主流 STT 方案的横向对比数据。

后续关注点

鉴于原帖带有线程标记,Google DeepMind 大概率会在后续帖文中补充产品页面、演示样例或开发者文档。值得关注的进展包括:是否通过 Gemini API 或 Vertex AI 开放调用、是否支持实时流式转写、以及在长音频、多说话人场景下的实测表现。对于需要将语音能力集成到产品中的开发者而言,建议持续关注官方线程以获取完整规格后再做选型决策。

信源