桃子桃子快讯
返回首页
模型发布

Sori-1B 音频语言模型:从零训练,告别纯文本先验

首尔大学研究者发布 10 亿参数音频-语言模型 Sori-1B,解码器完全在音频配对文本上从零训练,权重仅限学术使用。

2026.08.31 · 周一2 分钟阅读

Sori-1B 是一个 10 亿参数规模的音频-语言模型,由首尔国立大学(SNU)一位独立研究者开发。其最大特点是解码器完全在「音频配对文本」数据上从零训练,没有使用任何纯文本预训练阶段,也没有借助现成大语言模型做初始化——试图让模型在回答时真正依赖音频信号,而非依赖纯文本先验。

核心思路:从零训练,告别纯文本先验

作者指出,现有音频-语言模型(如 Audio Flamingo 3,AF3)即便把音频替换为静音,仍能保留约 74% 的「MMAU」基准上超出随机水平的优势——这说明这些模型很大程度上在「绕过」音频,仅靠文本先验作答。Sori-1B 的设计动机正是回应这一「伪多模态」问题:让语言模型自始至终只见过与声音配对的文本,使其被迫把语义锚定在音频上。

模型架构与训练资源

  • 编码器:直接复用 NVIDIA 开源的 Audio Flamingo Next 编码器,占总参数约 61.5%,训练全程冻结不更新;
  • 解码器、嵌入层、输出头以及一个自研的「听觉本体论 tokenizer」——词表基于音频概念类别而非传统文本词汇——全部从零训练;
  • 训练数据:约 7400 小时、475 万条音频-文本样本;
  • 训练硬件:仅使用 3 张 RTX 4090 显卡。

能力与配套工具

模型支持多种任务模式,包括四选一选择题(MCQ)、开放问答、音频描述(captioning)以及语音识别(ASR)。仓库附带推理端点处理器、一个可在终端运行合成音频的演示脚本,以及面向 MMAU test-mini 的评测脚本,方便研究者复现实验结果。

发布状态与许可

需要注意的是,Sori-1B 的代码仓库目前仍标注为「coming soon」。由于分发中包含 NVIDIA 的编码器,权重受其 OneWay 非商业条款约束,整体仅供学术与非商业用途,短期内难以直接用于商业落地。

信源