桃子桃子快讯
返回首页
产品功能

Epilude 发布 Model 4:本地化听写 cleanup 模型升级

Epilude 推出基于 Qwen 微调的第四代本地听写清理模型 Model 4,关键语义错误下降 56%。

2026.07.25 · 周六3 分钟阅读

语音听写工具 Epilude 近日上线了 Local Mode 的第四代 cleanup 模型 Model 4,在保持 1.5 GB 下载体积和原有速度不变的前提下,将关键语义错误降低了 56%。新模型基于 Qwen 系列基座微调而来,专注于把口述文本改写成可直接发送的文字,涵盖去填充词、修正标点、处理自我打断以及匹配语气等任务。

模型构成与运行方式

Model 4 是 Local Mode 中 cleanup 模型的换代版本,speech 模型并未改动。两者一起仍以原来的体积在 Mac 上本地运行,不会把任何音频或文字上传到外部。Model 4 仅支持 Apple Silicon,完整 AI cleanup 需要 16 GB 以上内存的 Mac;内存更小的设备仍可使用本地转写加基础格式化。所有解码采用 greedy 策略,结果完全可复现。

评测方法与结果

Epilude 维护了一套包含 90 个听写场景的内部基准,覆盖标点、格式、自我修正、语气控制、多语种与混合语种等内容,由前沿模型作为 judge 多次独立投票打分;同一场景只有在所有重复运行中都通过才算通过。

在新基准下,Model 4 比 Model 3 多通过 9 个场景,关键语义错误从 9 个降至 4 个,220 条压力输入下的指令泄露依然为 0:

  • 通过场景数:Model 3 69/90,Model 4 78/90
  • 关键语义错误:Model 3 9 个,Model 4 4 个
  • 指令泄露:两者均为 0

进步集中在容易翻车的几类场景,包括句中自我修正、日期与星期判定、混合语种,以及保留口语化语气。

训练中的两个发现

第一,标签质量比数据量更重要。在审计训练集中最难样本时,团队发现相当一部分样本在教给模型错误的模式,且这种错误对自动化过滤不可见;修正这些样本比堆数据更直接地带来了自我修正能力的提升。

第二,发布时有意选择「平均模型」。团队用不同随机种子训练了多个 cleanup 模型,每个模型都各有少量失败模式;最终发布的 Model 4 是这些模型的权重平均,结果超过任何一个单独模型,也没有继承各自的小毛病。权重平均虽是已有技术,但作者表示其相对挑选单模型的领先幅度出乎意料。

局限与可用性

Model 4 仍未解决长篇即兴段落的问题,剩余失败集中于较长的口头提问,是下一代的重点方向。Cloud Mode 在内部基准上整体仍领先,Local Mode 仍是隐私优先场景的选择。本地处理全程离线,Model 4 包含在 Epilude 订阅中,不再额外收费。已有用户更新应用后会被提示下载约 1.6 GB 的新模型,新用户可在「Settings → On-device」中开启。

信源