桃子桃子快讯
返回首页
产品功能

Cue 语音助手本地部署 Gemma 4:延迟下降 44%,推理边际成本归零

桌面语音代理 Cue 将 Gemma 4 E4B 部署在端侧用于文本润色,端到端延迟由 876ms 降至 488ms,用…

2026.07.21 · 周二3 分钟阅读

桌面语音代理 Cue 在默认语音润色(polish)管线中切换到本地运行的 Gemma 4 E4B 模型,端到端中位延迟从 876 毫秒下降到 488 毫秒,降幅达 44%,并将每次润色的边际推理成本降至零。该结果基于一个 227 条真实语音样本的基准集,覆盖英语与混合语言输入,测试在 Apple Silicon(M 系列)上通过 Ollama 完成。

语音润色的核心挑战

语音输入从原始语音转写(STT)流到可用文本,需要解决四类问题:补回标点、按句子切分、去除口头禅、修正上下文相关的同音词。Cue 团队发现,任何超过约 500 毫秒的延迟都会让用户感到卡顿,破坏「语音比打字更快」的体验。其原先基于云端模型的润色步骤会额外引入 800–900 毫秒,远超感知预算。

更棘手的是「过度润色」问题:部分模型会把口语化的表达打磨成正式书面语,丢掉用户的自我修正痕迹。团队的目标是让输出读起来像用户本人,而不是像模型。

本地化部署的实现路径

Cue 的润色管线保持简洁:用户按住快捷键说话 → 云端 STT 转为原始文本 → 本地 Ollama 调用 Gemma 4 E4B → 通过操作系统原生 API 将润色后的文本粘贴到光标处。Gemma 4 E4B 使用约 400 token 的紧凑系统提示词来编码润色规则。

其润色规则包括:

  • 补回标点并将文本切分为句子;
  • 跨语种去除口头禅与填充词;
  • 通过上下文判断修正同音词;
  • 根据当前活动输入框动态调整格式,例如终端命令「open terminal」末尾不加句号,而邮件正文则使用完整标点。

系统提示词会注入当前应用上下文(应用名、字段类型、占位符等),让模型判断用户是在写 Slack 消息、邮件还是终端命令。

架构反转与下一步规划

Cue 原本计划把 Gemma 4 仅作为离线回退方案,假设更大模型会带来更高准确率。但在 227 条真实语音样本基准测试后,团队发现 Gemma 4 E4B 的容量恰好足以完成格式化与纠错,又不会过度编辑,因此将架构反转为「本地 Gemma 4 为默认、云端模型为回退」。如果 Ollama 未运行,桌面应用会在启动时检测并自动路由到云端模型,保证功能不中断。

由于边际成本归零,Cue 将听写功能向所有用户开放,包括免费档位。在切换默认模型后四周内,活跃测试用户的听写使用量提升了约 30%,原本只发短消息的用户开始尝试长文本输入。

下一步,团队计划将 Gemma 4 拓展到两个方向:一是构建持久化本地记忆层,学习每位用户的口语风格、用词与格式偏好;二是探索 Gemma 4 的原生函数调用能力(通过 Ollama 的 tools API 直接暴露,无需 prompt engineering 适配层),让部分自包含的代理任务也能在本地完成。

信源