模型发布
GigaChat Audio 10B 发布:原生音频大模型,支持时序定位
Sber 团队开源 GigaChat Audio 10B 音频原生大模型,采用 Conformer+MoE 架构,配套发…
2026.07.26 · 周日约 3 分钟阅读
Sber 团队近日在 Hugging Face 上发布了 GigaChat Audio 10B,这是一款原生支持音频输入的大语言模型,文本底层基于 GigaChat 3.1 Lightning。模型以 Conformer 语音编码器配合模态适配器,将音频 embedding 直接送入混合专家(MoE)解码器,在保留原文本模型能力的同时扩展了对语音的理解。模型总参数 100 亿,激活参数约 18 亿。
架构与设计
GigaChat Audio 10B 采用三段式架构:
- Conformer 语音编码器,负责将原始音频转换为高层语义表示;
- 模态适配器(modality adapter),将语音特征映射到与文本 token 同一空间;
- MoE 解码器,承接 GigaChat 3.1 Lightning 的文本能力并融入音频信号。
这种「音频 embedding 直接进入 LLM 解码器」的设计,使得模型在接收语音的同时仍可执行纯文本推理与工具调用,无需外挂 ASR 模块。
核心能力
模型面向四类任务:
- 音频问答与音频分类;
- 时序定位(temporal grounding):可在长音频中定位事件起止时间,并输出带时间戳的事件描述与摘要;
- 工具调用(tool-use);
- 纯文本任务,能力与底座 GigaChat 3.1 Lightning 相当。
其中时序定位是本次发布的重点功能,相关训练数据为团队专为该任务构建的 TimeGround-1M 数据集,包含长音频与时间对齐的标注。
数据集与可复现资源
TimeGround-1M 已开源至 Hugging Face Datasets,覆盖长音频及其对应的时间戳级标注,用于训练和评估模型的时序理解能力。
已公开的资源包括:
- arXiv 论文:https://arxiv.org/abs/2607.10387
- 论文 PDF:https://arxiv.org/pdf/2607.10387.pdf
- TimeGround-1M 数据集:https://huggingface.co/datasets/ai-sage/TimeGround-1M
- 交互演示:https://huggingface.co/spaces/hugging-apps/gigachat-audio-10b-a1-8b-demo
行业意义
GigaChat Audio 10B 体现了将语音模态深度嵌入 LLM 主干网络的趋势,即「音频原生」而非「语音转文本后再问答」的范式。结合专门的时序定位数据集,模型在长音频事件理解场景(例如会议回顾、播客检索、监控分析)具备落地潜力。不过目前公开信息尚未提供详细的 benchmark 横向对比数据,社区可借助上述 Demo 与论文进一步评估其相对优势。
