桃子桃子快讯
返回首页
产品功能

xAI 发布 Grok Voice Transcribe 2.0,号称流式语音识别准确率第一

xAI 推出 Grok Voice Transcribe 2.0 多语言语音转文本模型,在 Artificial Ana…

2026.09.19 · 周六3 分钟阅读

xAI 近日宣布推出 Grok Voice Transcribe 2.0,这是一款面向多语言场景的语音转文本(speech-to-text)模型。据官方披露,该模型在第三方评测平台 Artificial Analysis 的流式(streaming)语音识别准确率榜单上位列第一,参评模型共 32 个。这是 xAI 继 Grok 聊天助手、图像生成、语音对话之后,在语音 AI 方向的进一步布局。

榜单表现

根据 xAI 公布的信息,Grok Voice Transcribe 2.0 在 Artificial Analysis 的流式语音识别准确率排名中位列第一,覆盖了 32 个同类模型。不过,官方目前没有披露具体的词错误率(WER)数字,也未说明评估覆盖的语言范围和测试集细节,因此该排名对应的实际能力差距尚待独立验证。

核心功能

Grok Voice Transcribe 2.0 面向实际语音转写场景提供了一组较为完整的功能集合:

  • 同时支持批处理(batch)与流式(streaming)两种转写模式
  • 说话人分离(speaker diarization),可在多人对话中区分不同说话人
  • 多通道转写(multichannel transcription),适配多麦克风输入
  • 关键词偏置(key term biasing),可针对专有名词或行业术语提升识别准确率
  • 文本格式化与语气词去除(filler word removal),输出更干净的转写文本
  • 智能断句检测(smart turn detection),便于对话场景使用

背景与意义

xAI 此前的产品重心集中在 Grok 文本大模型及其聊天应用上,语音能力主要体现在 Grok Voice 对话功能上。Grok Voice Transcribe 2.0 的发布意味着 xAI 开始把语音转文本作为独立的基础能力对外开放,后续可能被集成到 Grok API、第三方应用以及企业级转写服务中。

在当前 Whisper 系列、AssemblyAI、Google Speech-to-Text、Deepgram 等模型与服务的竞争格局下,Grok Voice Transcribe 2.0 以「榜单第一」作为切入市场的卖点,但其在不同语言、长音频、噪声环境下的真实表现,以及定价和开放程度,仍有待后续信息进一步确认。

信源