Gemini Omni 1.1 Flash 发布说明 / 更新内容

Gemini Omni 1.1 Flash 引入专业级视频可控性

Google 发布了 Gemini Omni 1.1 Flash,这是一套旨在将 AI 视频制作从简单的生成转向专业级控制的生成式视频功能套件。此次更新重点在于提高视频编辑的精度、通过低分辨率草稿降低迭代成本,以及通过高分辨率放大来提高最终输出质量。

增强的时间控制和场景扩展

Gemini Omni 1.1 Flash 通过允许开发者扩展现有视频场景,实现了更长的叙事能力。该模型现在可以分析长达 10 秒的前文背景——相比之前仅参考最后一秒的版本有了显著提升——以保持视觉一致性和叙事流。

  • 扩展限制: 视频可以以 10 秒为增量进行扩展。
  • 累计长度: 生成序列的总累计长度可达 40 秒。

通过关键帧插值实现精确的运动控制

为了消除跳剪并实现复杂的摄像机运动,Omni 1.1 允许用户指定镜头的前一帧和最后一帧。模型会生成在两个关键帧之间进行插值的连续视频,从而实现:

  • 复杂的摄像机轨道运动: 围绕主体的平滑过渡。
  • 缩放过渡: 进入或退出场景的无缝移动。
  • 循环片段: 创建完美无缝的循环视频。

制作效率:360p 草稿与 4K 放大

Omni 1.1 引入了分层分辨率策略以优化开发周期,将原型设计阶段与最终渲染阶段分开。

360p 快速原型设计

开发者可以生成 360p 分辨率的轻量级预览。这些草稿的生成速度比标准 720p 分辨率快 60%,成本仅为 720p 的三分之一,非常适合分镜脚本迭代和快速渲染。

4K 专业输出

对于最终制作,该模型支持 1080p 和 4K 的高分辨率输出,提供专业媒体部署所需的细节和清晰度。

多模态视频参考

Omni 1.1 支持包括视频参考在内的多模态输入。用户可以上传长达 3 秒的参考视频以保持角色一致性和视觉上下文。例如,开发者可以提供一个角色图像和一个特定舞蹈的参考视频,模型会将该角色的特征应用到参考视频中所捕捉的动作中。

社区观点与技术评论

虽然技术能力非常显著,但开发者社区就这些工具的实际应用和局限性提出了几点看法:

可控性 vs. 原生质量

从业者之间达成了一个日益增长的共识,即原生生成质量不再是主要的差异化因素。正如一位用户所指出的,“原生生成质量正成为入门门槛;可控性可能才是更重要的战场。”

草稿生成中的非确定性

一些用户担心 360p 360p 草稿功能可能会因为生成式 AI 的非确定性本质而受到削弱。如果一个提示词在 720p 或 4K 下产生的结果与在 360p 下产生的结果不同,那么草稿过程的效率就会降低。

缺失的功能需求

某些专业需求仍未得到解决。具体而言,将生成的视频与预先存在的音频同步(例如,与录制的对话进行对口型)的能力,是目前 Omni 1.1 套件中缺失的一个备受期待的功能。

伦理与行业影响

用户之间的讨论强调了对演员(画面和配音)可能产生的替代效应,以及在涉及人类主体的视频中持续存在的普遍“恐怖谷”效应。

Sources

相关