桃子桃子快讯
返回首页
模型发布

Gemini Omni 1.1 Flash 上线:面向专业视频生产的可控生成

Google DeepMind 发布 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、4K 升分辨…

2026.08.28 · 周五3 分钟阅读

Google DeepMind 于 8 月 27 日宣布推出 Gemini Omni 1.1 Flash,这是其生成式视频模型 Omni 的一次重要版本更新,重点是引入多项面向专业视频生产的可控生成能力,并已通过 Gemini API 在 Google AI Studio 中开放给开发者使用。Omni 系列原本以「真实世界推理 + 生成创作」为定位,本次更新使其正式具备生产可用(production-ready)能力。

场景延长:最长 40 秒的连贯叙事

Omni 1.1 Flash 引入了「场景延长」(scene extension)功能,允许开发者基于已有视频继续生成后续画面。模型现在可参考最多 10 秒的先前上下文,而此前的版本仅能参考最后一秒的画面,主体一致性和叙事连贯性均有明显提升。每次可按 10 秒为单位延长,单条视频累计上限为 40 秒。开发者可通过 Gemini API 中的 previous_interaction_id 字段传入上一段视频交互,从而延续同一场景。

首尾帧插值:精准控制运镜

新版本支持「首尾帧指定」(first and last frame interpolation),开发者只需给出起止两帧关键画面,模型即可在两帧之间生成连续视频。这一能力特别适合复杂运镜,例如环绕镜头、缩放转场以及无缝循环片段。Google DeepMind 在博文中给出了两个示例提示词,分别演示了鼓手与萨克斯演奏者之间的摇镜转场,以及镜头推入电视屏幕的连续运镜。

草稿模式与 4K 升分辨率

为加快迭代效率,Omni 1.1 Flash 提供 360p 草稿模式,生成速度相比标准 720p 提升最高 60%,成本约为 1/3,适合快速原型、故事板迭代和快速渲染。在最终输出阶段,模型可生成 1080p 或 4K 分辨率画面,满足专业制作对画质的要求。

多模态视频参考输入

新版本允许在提示中加入最多 3 秒的视频参考片段,使模型在生成新场景时能够保持视觉上下文和角色一致性。Google DeepMind 给出的示例演示了将三段不同舞者的参考视频中的舞蹈动作,分别「移植」到三个新的角色图像(狗、章鱼、熊)上,并在同一空间中合成一段不切换的连续镜头。

部署与可用范围

Omni 1.1 Flash 正在 Google 全开发者生态中逐步上线:

  • Google AI Studio:开发者可直接试用新版本。
  • Gemini Enterprise Agent Platform:企业开发者可部署该模型。
  • Google Flow:全球 Google AI Plus、Pro 与 Ultra 订阅用户也可使用,场景延长功能同步向这三档订阅用户开放。

Google DeepMind 同时提供了官方文档、Cookbook 与提示词指南,帮助开发者将场景延长、视频参考与升分辨率等能力集成到既有应用工作流中。

信源