MiniMax H3 视频模型接入 Luma Agents,支持原生立体声
Luma 宣布 MiniMax H3 视频生成模型上线 Luma Agents,支持文、图、视频、音频多模态参考,可生成…
Luma 在官方 X 账号发文宣布,其视频生成模型 MiniMax H3 已正式集成至 Luma Agents 平台,用户可通过文本、图像、视频与音频四类参考引导生成视频,单段最长 15 秒、分辨率达 2K,并自带原生立体声。新能力被定位为 Luma 创意工作流的一次扩展,强调在同一平台内完成从画面、运动到声音的一体化生成。
核心规格
根据 Luma 的官方说明,MiniMax H3 在 Luma Agents 中提供的能力要点如下:
- 单段视频最长 15 秒。
- 输出分辨率最高 2K。
- 音频为原生立体声,而非后期叠加。
- 同时支持文本、图像、视频和音频四类参考输入作为引导条件。
多模态引导
此次发布的重点在于将多种参考信号统一到同一个生成流程中:用户既可以用文字描述镜头内容与风格,也可以上传图像、视频或音频片段作为视觉与听觉层面的参考,从而在画面构图、运动节奏和声音氛围上获得更可控的结果。这与传统「文生视频」单一输入范式形成对比,更接近多条件联合驱动的生成方式。
工作流整合
MiniMax H3 被直接嵌入到 Luma 自有的 Agents 产品中,而非作为独立 API 单独发布。Luma 在宣传文案中强调「一个连续的工作流」,意在让用户在已有 Luma 创作链路里直接调用视频生成能力,减少跨工具切换。Luma 同时在帖子中附带了官方试用链接,引导用户体验。
行业背景
Luma 是较早布局 AI 视频生成的厂商之一,其前代模型 Ray2 在创作者群体中有一定使用基础。此次将新一代模型接入 Agents 平台,反映出 Luma 正将视频生成从「单点工具」向「一体化创意助手」演进。结合原生音频能力,模型在短视频、广告 demo、概念预演等对音画同步要求较高的场景中具备一定实用价值。但具体的技术细节、训练数据构成、与同类模型(如 Sora、Veo、Runway Gen-3 等)的对比信息,Luma 在本次公告中并未披露。
