桃子桃子快讯
返回首页
开源

Pipecat 发布开源语音智能体模型 PhoneLLM Alpha 1

Pipecat 推出基于 NVIDIA Nemotron Nano 的开源权重模型 PhoneLLM Alpha 1,专…

2026.08.29 · 周六3 分钟阅读

Pipecat 团队近日发布 PhoneLLM Alpha 1,一款面向语音智能体(voice agent)场景的开源权重模型,同时推出配套评测基准 PhoneBench v1。这是团队继在低延迟、多轮智能体工作负载方向持续投入后推出的首款开源模型。

模型规格与定位

PhoneLLM Alpha 1 基于 NVIDIA 的 Nemotron 3 Nano 30B-A3B 模型,使用 NVIDIA NeMo 框架进行全参数微调。与底座一致,它采用混合专家(MoE)架构,每次推理仅激活约 35 亿参数,可在低成本下实现高速推理。

模型采用 BSD 协议开源,无商业使用限制,用户可在自有基础设施上部署。官方声称,PhoneLLM 在特定语音智能体用例上达到与通用大模型相当的性能,但成本和延迟显著降低:

  • 性能与 GPT 5.6 Terra 持平
  • 运行成本低 94%
  • P95 首 token 时间快 1,300 毫秒

为什么需要专门的语音智能体模型

Pipecat 在长期构建语音智能体的实践中,识别出两个关键缺口:低延迟和精准工具调用。官方认为,当前主流前沿模型在使用思维链(thinking tokens)时会带来明显推理延迟;而在多轮对话中,许多大模型与小模型都难以稳定地准确调用工具——尤其在关闭思考模式时,常出现「假调用」,即模型声称已执行工具但实际未触发,给客户带来糟糕体验。

PhoneLLM 在训练中专门强化「在合适时间调用合适工具」的能力,无需开启思考模式即可稳定运行。官方进一步指出,行业正在从「越大越强」的通用前沿模型,转向针对特定任务微调的小型开源权重模型,以在准确率、推理速度、成本和数据隐私方面取得更优平衡。

PhoneBench v1 基准

随模型同步发布的 PhoneBench v1 用于评估大模型在电话智能体场景下的适配度,覆盖多个维度的能力:

  • 准确率与说话风格
  • 工具调用准确度与说做一致性
  • 事实依据与对话连贯性
  • 鉴权与转接规范
  • 调用者结果

针对语音输出难以程序化评估的特点,PhoneBench 采用 LLM 评审团结合高质量参考样本进行评分,确保评估口径与人类判断对齐。基准的测试场景、工具列表和系统提示均与训练数据隔离,以验证模型的真实泛化能力,避免「在考题上训练、在考题上测试」的风险。

延迟是系统工程问题

官方将语音到语音(voice-to-voice)的 P95 延迟目标设定为约 1,500 毫秒,这一预算需要分摊给网络、音频处理、应用逻辑以及 STT、LLM、TTS 全链路推理。他们为 LLM 首 token 时间设定的目标是 650 毫秒——预算相当紧张,因为 GPT 5.6 Terra 快速模式的 P95 首 token 已约 1,900 毫秒,单 LLM 一环就会超出整体延迟预算。

Pipecat 表示,团队会与企业客户合作,使用生产环境智能体的实际轨迹与专有数据,针对具体用例定制训练模型,PhoneLLM Alpha 1 是该方向上的一次示范,底层则依托 Nemotron 3 Nano 这一高效基座。

信源