桃子桃子快讯
返回首页
模型发布

Pika 发布音乐生成模型 Pika Music,支持四模态联合输入

Pika 推出音乐生成模型 Pika Music,将文本、歌词、声音与音乐参考四种输入统一送入共享潜在扩散解码器,一次生…

2026.08.21 · 周五2 分钟阅读

Pika 近日在 X 平台公布了其全新音乐生成模型 Pika Music,主打多模态联合输入与一体化生成能力,这也是这家以 AI 视频生成闻名的公司首次将生成能力正式拓展到音频领域。

四种输入模态,可独立可组合

Pika Music 接受四种输入信号:

  • 文本(text):用自然语言描述想要的歌曲内容或风格;
  • 歌词(lyrics):直接提供歌词文本;
  • 声音参考(voice references):提供参考人声样本;
  • 音乐参考(music references):提供参考曲目以传递整体「氛围」。

这四种模态既可以单独使用,也可以任意组合输入,由模型统一处理。

共享潜在扩散解码器:告别工作流拼接

Pika 强调,Pika Music 的核心并非将多个独立工作流串联,而是将所有信号统一送入同一个共享潜在扩散解码器(shared latent-diffusion decoder)。该解码器在生成过程中同时解析:

  • 音乐结构;
  • 人声特征;
  • 文字指令;
  • 参考作品的「风格氛围」(vibe)。

最终输出是一段完整的音轨,而非分段拼接的结果。Pika 在原文中明确写道:「Not a chain of separate workflows(不是一连串独立工作流)。」

仍待披露的信息

作为一家此前专注于视频生成的厂商,Pika 此番切入音乐生成赛道,意味着其多模态生成版图从视觉扩展到了音频。不过,目前披露的内容仍停留在产品预告层面,模型的具体参数规模、能力上限、上线时间,以及与 Suno、Udio 等成熟音乐生成产品的对比,尚未公布更多细节,后续值得持续关注。

信源