桃子桃子快讯
返回首页
开源

0.8B 参数本地模型,专攻听写文本清理:开放权重与对比

开发者发布基于 Qwen3-0.8B 微调的 SpeakoFlow Mini(Apache-2.0),专用于听写纠错,在…

2026.08.30 · 周日2 分钟阅读

一名独立开发者发布了名为 SpeakoFlow Mini 的开源模型,这是一个基于 Qwen3 系列 0.8B 参数规模基座(原文写作「Qwen3.5-0.8B」,与现有公开版本名不符,疑为笔误)微调而来的 Apache-2.0 许可模型,专门用于「听写文本清理」任务。该模型并非通用聊天或改写模型,而是接收语音转文字(STT)的输出,仅修正说话者真正纠正过的内容,其余则保持原样。

任务定位:克制改写

听写清理的核心难点在于「过度润色」。当一句话本身已经正确,普通模型仍可能擅自「改写」,在听写场景里这种不必要的修改等同于一次错误的编辑。SpeakoFlow Mini 的设计目标就是只处理真实的口头修正,如把「The deadline is Monday. Scratch that.」改为「The deadline is Wednesday.」,而把上下文里所有正确的句子原样保留。

基准对比:与前沿模型打平

作者在自建的英语专项基准上做了对照测试,使用同一段固定短提示词、并关闭推理:

  • SpeakoFlow Mini:70.7%
  • GPT-5.6 Luna(声称中的下一代前沿模型,作者未做更多描述):65.0%
  • 分差:+5.8 分
  • 95% 置信区间:[-1.5, +12.9]

置信区间跨零,作者明确指出这是「统计平局」而非胜出。同时强调:若改用更长提示词并开放推理预算,Luna 会更强,也更适合本基准之外的非常规情况。

微调收益与本地部署

与未微调的 Qwen3-0.8B 基座对比时,微调把分数从 47.3% 拉升至 70.7%,提升 +23.4 分,95% 置信区间 [+16.3, +30.3],改善显著。Q8_0 量化版本体积约 833 MB,可完全离线运行。模型文件、运行命令、量化结果、局限说明与样例已在 Hugging Face 仓库公开,但评测集本身未随权重发布。

局限与作者立场

对比条件受限:固定短提示词 + 关闭推理预算 + 单一英语专项基准,因此结论应严格理解为:在这种低开销配置下,0.8B 本地模型可以追平某前沿托管模型。作者在帖子中披露自己是 SpeakoFlow 与 SpeakoFlow Mini 的开发者,并表示希望社区反馈「模型改了本不该改内容」的失败案例。

信源