13M 参数语音模型跑上 10 美元微控制器
开发者将 NVIDIA 13.1M 参数 conformer 语音识别模型蒸馏量化后,部署到 ESP32-S3 微控制器…
一名开发者在 Reddit 的 r/LocalLLaMA 板块分享了近期个人项目:将一个 13.1M 参数的卷积-Transformer(conformer)语音识别模型,成功部署到售价不到 10 美元的 ESP32-S3 微控制器上。该模型是 NVIDIA 在 HuggingFace 上发布的小型 conformer ASR 模型的蒸馏与量化版本。
项目核心数据
经过量化处理后,模型体积压缩至 14MB,可完整烧录进微控制器闪存。运行时的资源占用如下:
- 闪存占用:约 14MB
- SRAM 占用:约 256KB
- PSRAM 占用:约 4MB
- 可转录音频时长:约 8 秒
在 ESP32-S3 硬件 8-bit 加速的帮助下,推理速度虽仍被作者形容为「痛苦地慢」,但相较其最初 5 秒音频需 10 分钟推理的版本已有大幅提升。
与 Whisper Tiny 的对比
作者也尝试将 OpenAI 的 Whisper Tiny 模型移植到同一平台,但结果并不理想:转录 5 秒音频需要 50 分钟以上,因此没有进一步优化。这从侧面说明,conformer 类模型在经过专门蒸馏和量化后,在极低端硬件上的可用性优于通用 Whisper 架构。
精度与效率的权衡
蒸馏与量化流程带来了一定的精度损失:在 HuggingFace 上的 ASR 基准测试中,词错误率(WER)上升了约 3 个百分点。作者在 GitHub README 中给出了完整评估结果,并强调 ESP32-S3 内置的 8-bit 硬件加速单元是让这套方案勉强可行的关键。
作者观点
作者在文末表达了对当前大模型研究方向的看法,认为业界过于追求在基准排行榜上的名次,模型参数量不断膨胀;相比之下,将模型压缩到廉价硬件上、让更多爱好者能够接触 AI 的研究更有实际意义。这类「小而美」的边缘部署项目,正是本地化、轻量化 AI 生态的重要组成部分。
