桃子桃子快讯
返回首页
开源

开发者开源 1.2B 游戏音乐生成模型 Localsong

社区开发者用单卡 H100 训练 8 天,发布 1.2B 参数 DiT 架构的纯器乐游戏音乐生成模型 Localsong…

2026.08.23 · 周日2 分钟阅读

一名社区开发者在 r/LocalLLaMA 发布了他从零训练的纯器乐游戏音乐生成模型「Localsong」。该模型基于 1.2B 参数的 DiT(Diffusion Transformer)架构,复用了 Stable Audio 3 的 VAE,仅在单张云端 H100 上训练 8 天即完成,模型权重与 WebUI 已开源至 Hugging Face。

项目概览

  • 模型规模:1.2B 参数的 DiT
  • 训练硬件:1 块云端 H100 GPU
  • 训练时长:8 天(从零训练)
  • 音频编解码器:复用 Stable Audio 3 的 VAE
  • 输出范围:纯器乐,不包含人声 / 歌词
  • 发布平台:Hugging Face(仓库名 Localsong/Localsong)

开发者表示,目标是覆盖比 Ace-Step、Stable Audio 3 等同类项目更广泛的器乐风格,尤其是面向游戏配乐场景。仓库中附带 WebUI 与若干 MP3 试听样本,用户可克隆后通过 uv run webui.py 在本地启动推理界面。

技术亮点

项目并未公开训练数据规模、采样率与上下文长度等细节,README 中也未提供与 Ace-Step、Stable Audio 3、MusicGen 等主流音频生成模型的客观对比(无 benchmark、无 MOS 评分)。开发者对「风格覆盖更广」的描述属于主观陈述,尚未经第三方验证。

从工程角度看,单卡 H100 在 8 天内完成 1.2B 规模 DiT 的从零训练,说明作者在数据流水线与训练策略上做了较激进的压缩;复用 Stable Audio 3 的 VAE 也降低了音频重建部分的开发成本,是社区音频模型常见的做法。

局限与待观察点

  • 无客观评测:缺少与基线模型的定量对比,无法判断实际质量差距。
  • 数据来源不透明:训练集规模、版权与构成均未披露。
  • 仅覆盖器乐:明确不支持人声 / 歌词生成。
  • 影响力有限:属于个人项目,影响面集中在开源音频社区。

试用与反馈

感兴趣的读者可前往 Hugging Face 仓库下载权重并运行 WebUI 体验,开发者也欢迎在评论区提供反馈以帮助后续迭代。整体而言,这是开源 TTS / 音频生成生态中一次小型但完整的实践记录。

信源