Gemini Omni Flash 发布

Gemini Omni Flash 发布

Google DeepMind 已宣布 Gemini Omni Flash,这是一个原生多模态模型,能够实现高质量视频的创建和对话式编辑。该模型将 Gemini 的推理能力与创意生成相结合,使用户能够基于真实世界知识和物理定律生成视频内容。

对话式视频编辑

Gemini Omni Flash 允许用户使用自然语言指令编辑视频,这些指令可以基于之前的交叉轮次。模型在多次编辑过程中保持角色、物理和场景连贯性的一致性。

  • 环境转换: 用户可以更改视频中的特定元素或整个世界(例如,将雕塑转变为气泡)。
  • 动作重新想象: 模型可以修改现有动作,添加新角色或对象,或转换录制视频中的特定时刻。
  • 迭代优化: 用户可以通过多轮对话调整环境、相机角度、风格或特定细节,而不会丢失原始场景的上下文。

基于知识的视频生成

Gemini Omni Flash 利用 Gemini 对历史、科学和文化背景的内部知识,超越简单的模式匹配,实现有意义的叙事。

  • 改进的物理: 模型直观地理解动能、重力和流体动力学,以创建更真实的运动,例如弹珠在链式反应轨道上滚动。
  • 复杂的视觉解释器: Omni 可以从简短提示生成教育内容,例如解释蛋白质折叠的粘土动画式停止运动视频。
  • 情境创造力: 模型可以融合语言和图像以遵循复杂指令,例如创建一个快速序列的 26 项代表字母表的内容,配有特定的视觉标记和伴随音乐。

多模态输入集成

Gemini Omni Flash 可以从以下任意组合的输入中合成单个连贯的视频输出:

  • 文本: 描述场景和风格的自然语言。
  • 图像: 用作参考的角色、场景或绘图图像,以确保与特定愿景的视觉一致性。
  • 视频: 用作起点或风格参考的现有视频片段。
  • 音频: 在发布时支持语音参考,其他音频输入类型计划在未来发布。

数字头像和安全

为了实现个性化内容创作,用户可以利用头像功能生成看起来和听起来像他们自己的视频,使用他们自己的声音。

为了确保负责任的 AI 开发,Google 已实施以下防护措施:

  • SynthID 水印: Gemini Omni 生成的所有视频都包含一个不可察觉的数字水印,以验证其 AI 来源。
  • 验证工具: 用户可以通过 Gemini 应用、Google Search 和 Chrome 中的 Gemini 验证 AI 生成的内容。
  • 受控音频编辑: 编辑视频中的音频和语音的功能目前正在进行进一步测试,以确保负责任的部署。

可用性

Gemini Omni Flash 正在以下平台推出:

  • 订阅者: 全球 Google AI Plus、Pro 和 Ultra 订阅者可通过 Gemini 应用和 Google Flow 使用。
  • YouTube 用户: 从 2026 年 5 月 17 日那一周开始,YouTube Shorts 和 YouTube Create App 的用户将免费获得推出。
  • 开发者: 开发者和企业客户的 API 访问权限将在未来几周内可用。

Sources