产品功能
Pika 公开生成模型底层架构:文本条件扩散 Transformer 输出 44.1 kHz 立体声
Pika 在 X 平台披露其生成模型的技术流程,采用文本条件扩散 Transformer 在压缩声学潜空间中生成,并由语…
2026.08.20 · 周四约 2 分钟阅读
AI 视频生成公司 Pika 在 X 平台发布了一条「Under the hood」技术解析贴,首次对外公开其生成模型的底层架构细节。整条信息以流程化方式呈现:从文本输入到最终音频输出,模型经历提示条件编码、扩散生成与波形解码三个阶段。
文本条件编码阶段
在输入端,文本提示首先经过 Transformer 进行条件编码,得到语义层面的条件信号。该信号将作为后续生成过程的内容控制依据,决定生成音频的主题、风格与语义内容。
扩散 Transformer 生成阶段
生成阶段采用文本条件扩散 Transformer,在压缩后的声学潜空间(acoustic latent space)中进行去噪生成。该路径与当前主流的 DiT(Diffusion Transformer)架构一致,将扩散过程与 Transformer 序列建模能力结合,从而在高维声学潜空间中高效生成结构化表示。
波形解码与训练策略
最终输出由一个语义-声学自编码器(semantic-acoustic autoencoder)将潜空间表示解码为 44.1 kHz 的立体声音频波形,达到 CD 级音质。在训练方法上,Pika 表示使用了 Flow Matching、教师-学生蒸馏(teacher-student distillation)以及基于人类反馈的后训练(RLHF / RLFH 风格对齐),以将生成路径压缩到少数几个高质量采样步骤,从而兼顾生成质量与推理效率。
Pika 此前以视频生成见长,此次公开的声学潜空间 + 44.1 kHz 立体声解码链路,暗示其技术栈已具备原生音频生成能力,但官方尚未透露该架构对应的具体产品形态或上线时间。
