Epilude Model 4 发布:基于 Qwen 微调的本地听写清理模型
Epilude 推出基于 Qwen 微调的第四代本地听写清理模型 Model 4,关键语义错误下降 56%,完全离线运行…
语音听写工具 Epilude 近日发布 Model 4,这是一款基于 Qwen 模型家族微调的本地端「清理模型」(cleanup model),配合其原有的语音识别模型,可在 Mac 设备上完成语音转文字与文本润色,且全部过程完全离线运行。这是 Local Mode 上线以来质量提升最大的一次模型更新,下载体积与运行速度与上一代持平。
模型定位与技术架构
Local Mode 由两个本地模型协同工作:语音模型负责将人声转写为原始文本,清理模型则对文本进行后处理,包括去除口头禅、修正标点、识别并纠正口语中的自我修正(self-correction)、匹配用户指定的语气风格。Model 4 是清理模型的第四代版本,底层基于 Qwen 模型微调,专门针对听写清理任务训练;语音模型在本版本中保持不变。两者合计仍占用约 1.5 GB 磁盘空间,运行速度与硬件要求与前代一致。
主要规格如下:
- 下载体积:一次性 1.5 GB(约 1.6 GB 含更新包)
- 支持硬件:Apple Silicon Mac
- 完整 AI 清理:内存 ≥ 16 GB 的 Mac
- 解码方式:贪心解码,完全确定性输出
- 网络依赖:完全离线运行
评估方法与关键指标
Epilude 团队认为,听写模型的平均质量指标意义有限。他们以「关键错误」(critical errors)作为核心评估标准——即任何改变原意或泄露模型指令的输出都会被计为一次关键错误,且新模型不得引入比上一代更多的关键错误,无论平均表现提升多少。
内部 benchmark 包含 90 个听写场景,覆盖标点、格式、自我修正、语气控制、多语言及混合语言输入。每一轮评估都由前沿模型担任评委进行多轮独立投票,只有在所有重复运行中均通过的场景才被记为通过。
关键结果
在内部 benchmark 上,Model 4 比 Model 3 多通过 9 个场景,关键语义错误下降 56%:
- 场景通过数(满分 90):Model 3 通过 69 个,Model 4 通过 78 个
- 关键语义错误:Model 3 出现 9 次,Model 4 降至 4 次
- 指令泄露(220 条输入压力测试):两代模型均为 0
改进集中体现在四类典型难点:中句自我修正、日期与星期识别、混合语言转写、以及保留口语中犹豫语气的自然表达。官方示例显示,Model 4 能够正确将「let's meet Thursday」从自我修正语句中还原、保留说话者实际使用的姓名、维持混合语言不被自动翻译,并在用户明确要求口语风格时保留「kinda」等语气词。
训练经验与局限
Epilude 总结了本版本训练中的两点发现:一是数据标签质量优于数据量——审计最难样本时发现,相当比例的标注以自动过滤难以察觉的方式「教错」了模型,修正这些样本而非追加数据,是自我修正能力提升的关键;二是刻意发布「平均模型」——团队对若干仅随机种子不同的训练结果做了权重平均(weight averaging),最终模型在所有指标上均优于任一单一 run,且不再带有各自的偶发缺陷。
团队也承认 Model 4 仍不完美:长篇、跑题的连续口述仍是失败案例的集中区,尤其是较长的口语提问;云端模式在整体内部套件上仍优于 Local Mode,本地模式的核心价值仍是隐私优先。
隐私与可用性
Model 4 包含在 Epilude 订阅中,不额外收费。所有音频与文本均在本地处理,不会发送至 Epilude 或任何第三方。已使用 Local Mode 的用户在更新应用后会收到约 1.6 GB 的新模型下载提示。
