产品功能
ThunderPhone v2:面向电话场景的多模型语音 AI 栈
ThunderPhone 发布 v2 版语音 AI 架构,通过多路转写、思考/非思考模型混用与模型集群,解决传统三段式管…
2026.08.27 · 周四约 3 分钟阅读
语音 AI 是过去一年多来的热门方向,既用于自动化电话呼叫,也被集成进各类应用的人机交互中。ThunderPhone 团队近日在 Hacker News 发布 v2 版本,提出一种针对电话场景优化的语音 AI 栈,目标是突破传统「语音转写 → 大模型生成文本 → TTS 合成语音」三段式管线的体验瓶颈。
传统三段式管线的三大痛点
作者 Alex 在介绍中指出,当前主流的语音 Agent 多采用三段式管线,但在真实电话场景中表现往往差强人意,原因可以归结为三点:
- 速度与能力的矛盾:电话对话要求低延迟,通常只能使用非思考型 LLM,这导致模型容易出错,让对话跑偏。
- 信息在转写环节流失:依赖单一转写模型把语音转成文本,会丢失大量音频中的细节;一旦转写出错,下游 LLM 很难纠错,错误会一路传到回复端。
- 自然对话处理困难:包括过滤背景人声、判断何时该被打断(例如允许「呃,等一下」打断,但不让「嗯嗯」打断)等,都直接关系到对话是否自然。
作者认为,从「苦涩的教训」思路出发,最终的解决方案大概率是「全双工」模型——持续接收并输出音频,实现流畅的双向交互,并在后台调用更智能的模型。OpenAI 近期发布的 GPT-Live 似乎率先朝这一方向迈出实质性一步,但相关技术尚不能直接接入电话场景。
ThunderPhone v2 的技术思路
在真正的全双工模型成熟之前,ThunderPhone v2 通过组合多种已有模型来提升电话场景下的表现,核心思路有三条:
- 多路并行抓取音频信号:同时运行多个转写模型,并将原始音频直接送入 LLM,从而大幅降低错误率,尤其在数据录入、多语言通话等高难度任务上。
- 思考型与非思考型 LLM 并用:让模型在合适的时候给出即时回应,在需要时主动表示「让我想想」,再由更强的模型给出最终答案。
- 大规模模型集群:将大量小模型(以及少量大模型)拼接在一起,在嘈杂环境、扬声器通话等困难条件下提升对话自然度。
分层定价与基准成绩
ThunderPhone 将这套栈按能力分成三档定价:
- Spark(2 美分/分钟):定位为团队所知的市面上最便宜的档位,足以应对简单的事务性电话。
- Bolt(5 美分/分钟):中间档,是其产品中速度最快的模型。
- Storm(9 美分/分钟,可加 3 美分开启增强智能):旗舰档,能够处理相当复杂的电话,极少出错;在增强智能开启的情况下,据称在 Big Bench Audio 基准上达到 99.4% 的准确率,刷新该榜单纪录。
适用场景与定位
ThunderPhone 主要面向 B2B 客户,例如客服自动化、外呼等场景;同时也支持个人用途,例如搭建智能语音邮箱、替用户致电餐厅订位、致电药房查询处方等。作者表示,除了少数「商业秘密」之外,欢迎就语音 AI 行业及其发展方向进一步交流。
需要指出的是,ThunderPhone 是一家小型创业公司,本次更新本质上是其产品营销与技术介绍,文中所述的基准成绩尚未见到独立第三方验证,行业整体仍处在快速演进阶段。
