桃子桃子快讯
返回首页
模型发布

GigaChat Audio 10B 发布:原生音频大模型,支持时序定位

Sber 团队开源 GigaChat Audio 10B 音频原生大模型,采用 Conformer+MoE 架构,配套发…

2026.07.26 · 周日3 分钟阅读

Sber 团队近日在 Hugging Face 上发布了 GigaChat Audio 10B,这是一款原生支持音频输入的大语言模型,文本底层基于 GigaChat 3.1 Lightning。模型以 Conformer 语音编码器配合模态适配器,将音频 embedding 直接送入混合专家(MoE)解码器,在保留原文本模型能力的同时扩展了对语音的理解。模型总参数 100 亿,激活参数约 18 亿。

架构与设计

GigaChat Audio 10B 采用三段式架构:

  • Conformer 语音编码器,负责将原始音频转换为高层语义表示;
  • 模态适配器(modality adapter),将语音特征映射到与文本 token 同一空间;
  • MoE 解码器,承接 GigaChat 3.1 Lightning 的文本能力并融入音频信号。

这种「音频 embedding 直接进入 LLM 解码器」的设计,使得模型在接收语音的同时仍可执行纯文本推理与工具调用,无需外挂 ASR 模块。

核心能力

模型面向四类任务:

  • 音频问答与音频分类;
  • 时序定位(temporal grounding):可在长音频中定位事件起止时间,并输出带时间戳的事件描述与摘要;
  • 工具调用(tool-use);
  • 纯文本任务,能力与底座 GigaChat 3.1 Lightning 相当。

其中时序定位是本次发布的重点功能,相关训练数据为团队专为该任务构建的 TimeGround-1M 数据集,包含长音频与时间对齐的标注。

数据集与可复现资源

TimeGround-1M 已开源至 Hugging Face Datasets,覆盖长音频及其对应的时间戳级标注,用于训练和评估模型的时序理解能力。

已公开的资源包括:

行业意义

GigaChat Audio 10B 体现了将语音模态深度嵌入 LLM 主干网络的趋势,即「音频原生」而非「语音转文本后再问答」的范式。结合专门的时序定位数据集,模型在长音频事件理解场景(例如会议回顾、播客检索、监控分析)具备落地潜力。不过目前公开信息尚未提供详细的 benchmark 横向对比数据,社区可借助上述 Demo 与论文进一步评估其相对优势。

信源