Pika 拆解音频生成架构:视频与声音在潜空间 token 层面对齐
Pika 在 X 上分享 Soundtrack 技术原理,通过潜扩散 Transformer 同时建模视觉与音频时间线。
AI 视频生成公司 Pika 在其官方 X 账号上发布了一则技术说明,首次详细描述了旗下 Soundtrack 功能的底层架构。该功能可将文字描述自动转化为与画面在时间、节奏和场景层面同步的音频轨道,是 Pika 在多模态视频生成方向上的关键组件。
核心思路:两条 token 流并行建模
与传统「先生成视频再配音」的串联流程不同,Pika 的 Soundtrack 在设计之初就把音频视为视频生成过程的一部分。系统会先把输入视频压缩成一组「潜空间 token」,这些 token 保留了原画面的时间节奏、运动轨迹与场景布局信息。
与此同时,用户输入的文字提示会被编码为另一组「语义 token」,用来指定画面中应当出现的声音内容——例如「狗叫声」「城市车流声」或「雨点打在窗户上」。两条 token 流分别对应「何时发声」与「发出何种声音」。
跨模态注意力让音画自动对齐
Pika 介绍,其核心模型是一个潜扩散 Transformer(Latent Diffusion Transformer)。在音频去噪生成的过程中,Transformer 通过跨注意力机制(cross-attention)同时读取上述两组 token:
- 从视频潜空间 token 中学习场景的时序结构与空间语境;
- 从语义 token 中提取应出现的声音概念与风格。
这种设计使得模型在生成每一段音频时,都能同时回答两个问题:「这段画面在演什么」以及「此时该发出什么声音」,由此实现音画在帧级别的时间对齐,而非简单的拼接。
业内意义与局限
将视频与音频在统一的潜空间内联合建模,是当前多模态生成领域的重要探索方向。OpenAI 的 Sora、Runway 的 Gen 系列等竞品目前仍主要聚焦于画面本身,音频生成大多依赖后期叠加或独立模型。Pika 把音频纳入视频扩散过程的做法,理论上可以让口型、环境音、动作节奏更自然地匹配,但也带来更高的算力开销与训练数据要求。
不过,Pika 此次仅披露了架构层面的高层概述,并未公开具体的训练数据集规模、参数量、推理延迟或与基线方案的定量对比,因此其实际效果仍需等待独立评测验证。
