Gemini Omni 1.1 Flash 发布说明 / 更新内容

Google DeepMind 推出了 Gemini Omni 1.1 Flash,这是一套生成式视频功能和创意控制工具,旨在使生成式视频达到专业级生产标准。该更新可通过 Google AI Studio 中的 Gemini API 使用,重点在于为构建媒体编辑软件和创意工具的开发者提高可控性、迭代速度和输出质量。

增强型场景扩展,实现叙事一致性

Gemini Omni 1.1 Flash 允许用户无缝扩展现有视频片段。该模型现在可以分析长达 10 秒的前文内容——相比之前仅参考最后一秒的模型,这是一个显著的提升——从而提高视觉一致性和叙事连贯性。

视频可以以 10 秒为增量进行扩展,累计总长度可达 40 秒。

通过帧插值实现精确的运动控制

Omni 1.1 支持指定镜头的前后帧。模型会在两个关键帧之间生成连续的视频,这有助于创建复杂的相机轨道运动、缩放过渡以及无跳切的无缝循环片段。

通过 360p 草稿进行优化的原型设计

为了加速迭代过程,Omni 1.1 支持生成 360p 分辨率的轻量级预览。这些草稿的生成速度比标准 720p 分辨率快多达 60%,且成本仅为三分之一,非常适合快速原型设计和分镜脚本迭代。

专业级分辨率与放大技术

Omni 1.1 支持可用于专业生产的高分辨率输出,并具备将视频放大至 1080p 或 4K 分辨率的能力。

多模态视频参考

开发者现在可以将长达 3 秒的视频作为多模态输入的一部分。这使得模型在生成新内容时,可以通过参考上传视频文件中的特定动作或场景,来保持角色一致性和视觉上下文。

可用性与集成

Gemini Omni 1.1 Flash 可通过以下几个 Google 平台使用:

  • Google AI Studio: 直接访问以进行构建和测试。
  • Gemini Enterprise Agent Platform: 为企业级开发者提供部署选项。
  • Google Flow: Google AI Plus, Pro, 和 Ultra 订阅用户可用。
  • Gemini App: 全球范围内的 Google AI Plus, Pro, 和 Ultra 订阅用户均可使用场景扩展功能。

Sources

相关