模型发布
Pika 发布音乐生成模型 Pika Music,支持四模态联合输入
Pika 推出音乐生成模型 Pika Music,将文本、歌词、声音与音乐参考四种输入统一送入共享潜在扩散解码器,一次生…
2026.08.21 · 周五约 2 分钟阅读
Pika 近日在 X 平台公布了其全新音乐生成模型 Pika Music,主打多模态联合输入与一体化生成能力,这也是这家以 AI 视频生成闻名的公司首次将生成能力正式拓展到音频领域。
四种输入模态,可独立可组合
Pika Music 接受四种输入信号:
- 文本(text):用自然语言描述想要的歌曲内容或风格;
- 歌词(lyrics):直接提供歌词文本;
- 声音参考(voice references):提供参考人声样本;
- 音乐参考(music references):提供参考曲目以传递整体「氛围」。
这四种模态既可以单独使用,也可以任意组合输入,由模型统一处理。
共享潜在扩散解码器:告别工作流拼接
Pika 强调,Pika Music 的核心并非将多个独立工作流串联,而是将所有信号统一送入同一个共享潜在扩散解码器(shared latent-diffusion decoder)。该解码器在生成过程中同时解析:
- 音乐结构;
- 人声特征;
- 文字指令;
- 参考作品的「风格氛围」(vibe)。
最终输出是一段完整的音轨,而非分段拼接的结果。Pika 在原文中明确写道:「Not a chain of separate workflows(不是一连串独立工作流)。」
仍待披露的信息
作为一家此前专注于视频生成的厂商,Pika 此番切入音乐生成赛道,意味着其多模态生成版图从视觉扩展到了音频。不过,目前披露的内容仍停留在产品预告层面,模型的具体参数规模、能力上限、上线时间,以及与 Suno、Udio 等成熟音乐生成产品的对比,尚未公布更多细节,后续值得持续关注。
