开源
Superwhisper 开源 S1-mini:0.6B 参数的 ASR 文本规范化模型
Superwhisper 发布首个开源权重模型 S1-mini,基于 Qwen3-0.6B 微调,专为语音转写结果做文本…
2026.08.20 · 周四约 3 分钟阅读
Superwhisper 近日发布其首个开源权重语言模型 S1-mini,这是一个参数量仅 0.6B 的文本规范化模型,专门用于把 ASR(自动语音识别)的原始转写结果改写为干净、规范的书面文本。该模型基于阿里通义千问的 Qwen3-0.6B 微调而来,采用 Apache 2.0 协议发布,权重已在 Hugging Face 上架,同时提供了兼容 llama.cpp 的 GGUF 版本。
模型定位与核心能力
S1-mini 不是一个通用对话模型,它只做一件事:把一段未经整理的语音转写文本清洗成可读的书面形式。具体能力包括:
- 去除语气词(um、uh、like 等填充词)
- 合并重复与自我修正,将语句归一到说话者最终确认的内容
- 添加标点与大小写
- 将口语化的数字、日期、时间、货币、邮箱地址转换为书面形式
模型在 7,519 条英文样本的留出测试集上达到 94.8% 的 token 准确率。当前版本仅支持英文。
架构与运行规格
S1-mini 参数量为 596M(非嵌入层 0.44B),共 28 层,使用 GQA 注意力(16 个 Q 头、8 个 KV 头),训练精度为 BF16。量化后体积仅 462 MiB,可在笔记本 CPU 上流畅运行。推荐输入长度约 1,000 tokens,更长的转写文本需分段处理。
使用方式
模型通过一个「控制行」来驱动,控制行包含 Styling、Structure、Context 三个独立轴,每个轴都有多个训练过的取值组合:
- Styling:casual / semi-casual / semi-formal / formal,控制正式程度
- Structure:prose / lists,决定是否使用列表
- Context:general / email,设置目标场景
官方提示词与控制行格式是模型训练输入的一部分,必须严格按文档发送,否则可能出现幻觉或乱码输出。代码示例使用 Hugging Face transformers(≥ 4.51.0),并通过 enable_thinking=False 关闭 Qwen3 的思维链模式。
获取与许可
- Hugging Face 模型仓库:
superwhisper/s1-mini,已打 tag,可通过revision="v1"固定版本 - GGUF 构建:
superwhisper/s1-mini-GGUF,兼容 llama.cpp、Ollama、LM Studio 等 - 协议:Apache 2.0 + 命名条款(衍生模型需保留 Superwhisper 命名)
开发者可将其集成到自己的听写应用中,作为 ASR 之后的后处理步骤。
