桃子桃子快讯
返回首页
产品功能

Pika 公开生成模型底层架构:文本条件扩散 Transformer 输出 44.1 kHz 立体声

Pika 在 X 平台披露其生成模型的技术流程,采用文本条件扩散 Transformer 在压缩声学潜空间中生成,并由语…

2026.08.20 · 周四2 分钟阅读

AI 视频生成公司 Pika 在 X 平台发布了一条「Under the hood」技术解析贴,首次对外公开其生成模型的底层架构细节。整条信息以流程化方式呈现:从文本输入到最终音频输出,模型经历提示条件编码、扩散生成与波形解码三个阶段。

文本条件编码阶段

在输入端,文本提示首先经过 Transformer 进行条件编码,得到语义层面的条件信号。该信号将作为后续生成过程的内容控制依据,决定生成音频的主题、风格与语义内容。

扩散 Transformer 生成阶段

生成阶段采用文本条件扩散 Transformer,在压缩后的声学潜空间(acoustic latent space)中进行去噪生成。该路径与当前主流的 DiT(Diffusion Transformer)架构一致,将扩散过程与 Transformer 序列建模能力结合,从而在高维声学潜空间中高效生成结构化表示。

波形解码与训练策略

最终输出由一个语义-声学自编码器(semantic-acoustic autoencoder)将潜空间表示解码为 44.1 kHz 的立体声音频波形,达到 CD 级音质。在训练方法上,Pika 表示使用了 Flow Matching、教师-学生蒸馏(teacher-student distillation)以及基于人类反馈的后训练(RLHF / RLFH 风格对齐),以将生成路径压缩到少数几个高质量采样步骤,从而兼顾生成质量与推理效率。

Pika 此前以视频生成见长,此次公开的声学潜空间 + 44.1 kHz 立体声解码链路,暗示其技术栈已具备原生音频生成能力,但官方尚未透露该架构对应的具体产品形态或上线时间。

信源