桃子桃子快讯
返回首页
模型发布

阶跃星辰发布 StepAudio 3 音频模型家族,含语音、识别与音乐五大能力

阶跃星辰推出 StepAudio 3 共 5 个音频模型,在对话动态与语音推理榜单排名第一,ASR 词错误率降至 1.7…

2026.09.16 · 周三2 分钟阅读

阶跃星辰(StepFun)近日推出 StepAudio 3 音频模型家族,包含 5 个面向不同任务的模型,覆盖实时语音对话、语音识别(ASR)、语音生成(TTS)、音频生成与音乐生成。这是该公司在语音 AI 方向的一次集中更新,官方强调模型已开放使用,可在 Voice AI Lab 体验。

五大模型覆盖完整音频链路

StepAudio 3 家族由 5 个模型组成,分别对应实时语音交互、语音识别、语音合成、通用音频生成以及音乐生成。官方表示,模型面向构建语音智能体(voice agent)的开发场景,支持打断处理、边说边推理以及调用工具等能力,意味着模型不只完成单轮语音转换,还可在对话过程中结合外部工具完成复杂任务。

基准测试成绩亮眼

在第三方评测平台 Artificial Analysis 的语音榜单中,StepAudio 3 的实时模型位列第一:

  • 对话动态(Conversational Dynamics)得分 98.9%;
  • 语音推理(Speech Reasoning)得分 99.7%。

语音识别方面,模型在该平台的 ASR 词错误率(WER)为 1.7%,官方称与榜单上最优成绩持平。这两项数据表明,新模型在自然对话交互与语音内容理解两个维度都达到了当前较高水平。

面向语音智能体开发

与传统 TTS 或 ASR 模型不同,StepAudio 3 强调「对话中的推理」与工具调用,使语音模型本身具备一定的 agent 能力。官方介绍的场景包括:语音对话中的实时打断、说话过程中完成推理判断、以及通过语音直接调用外部 API 或工具。这意味着开发者可以用它构建更接近真人口语习惯的交互式语音应用,而不仅限于朗读式输出。

获取方式

StepAudio 3 目前已在阶跃星辰的 Voice AI Lab 平台上线,官方博客同步发布介绍。感兴趣的开发者可直接访问 Voice AI Lab 试用,并参考官方博客了解各模型的适用场景与接口细节。

信源