腾讯ARC开源SCoPE:给视频扩散模型加相机轨迹控制
腾讯ARC发布SCoPE,通过视线坐标位置编码让Wan2.2-I2V视频生成支持精确相机轨迹控制,并开源代码与Demo。
腾讯ARC(腾讯应用研究中心)开源了一项面向视频扩散Transformer的工作 SCoPE(Sightline-Coordinate Positional Encoding),并针对阿里 Wan2.2-I2V-A14B 模型发布了自包含的推理代码。开发者无需单独下载 Wan2.2 的模型检查点,即可按"首帧+文本提示+相机轨迹"的方式生成视频。
SCoPE 要解决什么问题
目前的图生视频(image-to-video)模型虽然能基于一张首帧生成连贯动态内容,但对相机运动的可控性仍然偏弱。常见做法只能靠文字提示"推、拉、摇、移"来隐式引导,难以精确复现指定轨迹。SCoPE 的切入点是把"相机视线(sightline)"——也就是相机在三维空间中的位置和朝向——作为显式的位置坐标注入 Transformer 的位置编码(positional encoding),从而让相机运动成为模型可学习的几何信号。
方法的关键思路
SCoPE 的名称已经透露了核心机制:Sightline-Coordinate Positional Encoding。具体来说:
- 把相机视线作为额外的位置坐标维度;
- 把这些坐标拼接到原有的位置编码中,输入到预训练好的视频扩散 Transformer;
- 在不破坏原有 image-to-video 先验的前提下,让模型学会按照给定相机轨迹拍摄。
这意味着,开发者可以先提供一张画面作为起点,再描述相机该怎么运动(例如"绕主体旋转 30 度"、"沿 Y 轴缓慢推进"等),模型就能在保持原图内容的同时,按指定视角生成后续帧。
与 Wan2.2-I2V-A14B 的结合
本次仓库针对 Wan2.2-I2V-A14B 做了适配,将视频扩散主干与 SCoPE 位置编码改造整合在同一发布包内。仓库内含推理所需的全部组件,因此用户无需再单独获取 Wan2.2-I2V 权重,开箱即用。
资源与体验入口
研究者和开发者可通过以下渠道获取资料或直接试用:
- 论文:arXiv 链接 https://arxiv.org/abs/2606.27345
- 代码:github.com/TencentARC/SCoPE
- 项目页:visual-ai.github.io/scope
- 在线 Demo:Hugging Face Spaces 的 TencentARC/scope-camera-video-generation
对视频生成、可控生成以及 Diffusion Transformer 位置编码方向感兴趣的研究者,可以从论文与代码仓库入手,进一步分析 SCoPE 在相机轨迹精度、与不同视频底座模型兼容性上的边界。
