桃子桃子快讯
返回首页
产品功能

Epilude 发布端侧 Model 4.1,基于 Qwen 微调的听写清理模型

Mac 听写工具 Epilude 推出 Local Mode 的 Model 4.1,基于 Qwen 系列开源权重微调,…

2026.07.29 · 周三3 分钟阅读

Mac 端听写工具 Epilude 近日上线 Model 4.1,作为其 Local Mode 中本地清理模型的最新迭代。新版本针对 Model 4 在长篇口述中偶尔出现的「跑题与重复」问题进行了优化,官方称输出更紧凑、关键错误更少,并保留完全离线、本地运行的使用体验。

模型定位与基础架构

Local Mode 在 Mac 上同时运行两个本地模型:语音模型负责把声音转成文字,清理模型则对原始转写文本进行润色,包括去除口头语、修正标点、处理「说到一半又改口」等自我纠正,以及遵循用户指定的语气风格。Model 4.1 是清理模型的新版本,基于 Qwen 系列的开源权重进行微调;语音模型本次未做改动。整套系统的本地占用体积与硬件门槛与 Model 4 保持一致。

主要规格如下:

  • 下载体积:1.5 GB,一次性下载
  • 硬件要求:Apple Silicon Mac
  • 完整 AI 清理:需要 16 GB 及以上内存
  • 解码方式:贪心解码,完全确定性输出
  • 连接要求:完全离线运行

评估方法

Epilude 维护了一个包含 90 个听写场景的内部基准,覆盖标点、格式、自我纠正、语气控制、多语种、混合语种口述以及长输入结构。每个候选模型都会在该基准上反复运行,由前沿模型担任评判员,对每条输出进行多次独立投票;只有当某个场景在每一次评判中都通过时,才计为「通过」。团队还会对相同输出做重复评分,避免把评判噪声误判为模型变化。官方明确表示该基准不对外公开,外部结果不可与其直接比较。

关键结果

在这套内部基准上,Model 4.1 比 Model 4 多通过一个场景,关键错误数量也进一步下降,且未引入新的错误类型:

  • 通过场景数(满分 90):Model 4 为 78,Model 4.1 为 79
  • 关键错误数:Model 4 为 4,Model 4.1 为 3

官方指出,剩余的提升主要体现在「长时间说话后才显现」的任务上:保持长回答的方向一致、避免重复,以及在被过度清理时仍忠实于说话人原意。

经验与局限

Epilude 表示,这一轮迭代再次印证了一条经验:评估质量必须与想要避免的失败类型严格对齐,宽泛的总体分数可能掩盖住「用户绝不会发出」的那一句话。团队据此把质量门槛细化到「长输入忠实度」,并在新模型上用多次重复运行加以验证。同时,发布也强调了模型平均(model averaging)这一已知技术的作用——通过组合多个模型来抑制偶发失败模式,得到更稳定的清理效果。

官方也坦承 Model 4.1 并不完美:当一段口述较长且结构复杂,特别是同一句话中夹杂多处自我纠正、引述材料以及语气切换时,本地清理仍然比云端模式更难处理。在音频和文本必须留在本地的场景下,Local Mode 仍是首选。

后续方向

Epilude 表示将继续围绕真实写作中最棘手的场景改进模型,包括更长输入的处理、多语种听写,以及在被清理的同时更准确地保留说话人意图。用户可通过官方 Help Center 反馈新模型带来的体验变化或具体错误。

信源