桃子桃子快讯
返回首页
研究论文

SAGA:可识别生成模型的 AI 视频来源溯源框架

arXiv 新论文提出 SAGA,首次实现对生成式 AI 视频的多粒度来源溯源,可在五层级定位生成模型。

2026.07.25 · 周六3 分钟阅读

随着生成式 AI 的快速普及,合成视频的滥用风险持续走高,而传统的「真 / 假」二分类检测已难以应对复杂场景。arXiv 上发表的一篇论文提出 SAGA(Source Attribution of Generative AI videos),将视频溯源从「判断真假」推进到「识别由哪个模型生成」,为取证与监管提供更细粒度的线索。

核心思路:从二分类到多粒度溯源

现有检测方法大多只能输出「真或假」的二元结论,SAGA 的差异化在于引入五层粒度的来源归属:

  • 真实性(是否由 AI 生成);
  • 生成任务(如 T2V 文本生成视频、I2V 图像生成视频等);
  • 模型版本;
  • 开发团队;
  • 具体生成器(即精确到某一模型实例)。

这种层级化设计使得取证人员可以快速定位可疑视频的来源厂商甚至版本,从而有针对性地追溯责任、比对违规内容。

技术方案:视频 Transformer + 数据高效策略

SAGA 采用一种新的视频 Transformer 架构,并基于一个鲁棒的视觉基础模型提取特征,以更有效地捕捉生成模型在时空维度留下的伪影痕迹。针对真实场景中标注数据稀缺的痛点,论文提出了「预训练 + 溯源」的数据高效策略:

  • 每个类别仅需 0.5% 的来源标注数据;
  • 即可在溯源任务上达到与全监督方法相当的性能。

这一设计显著降低了大规模标注成本,更贴近真实取证环境。

可解释性:Temporal Attention Signatures

为了让溯源结果「看得懂」,作者提出一种名为 Temporal Attention Signatures(T-Sigs)的可视化方法,用于呈现模型在时间维度上学到的差异模式。据论文描述,这是首次为「不同视频生成器为何可区分」提供可视化解释,有助于研究者与监管方理解溯源依据本身。

实验与意义

论文在多个公开数据集上进行了测试,并包含跨域场景实验,声称在合成视频溯源(provenance)任务上设立了新的基准(benchmark)。从应用角度看,SAGA 面向的是深度伪造取证、内容平台审核以及监管合规等场景,在模型迭代速度远超检测工具的当下,「直接锁定生成模型」的能力具备一定实用价值。

论文信息

  • 标题:Saga: Source Attribution of Generative AI Videos
  • 编号:arXiv:2511.12834 [cs.CV]
  • 提交作者:Rohit Kundu 等
  • v1 提交时间:2025 年 11 月 16 日;v2 修订时间:2026 年 4 月 2 日

目前该工作以预印本形式发布,正式同行评审与开源情况有待进一步跟进。

信源