Gemini Omni: Google DeepMind 在多模态视频创作领域的飞跃
生成式 AI 的格局正在从静态图像生成转向动态、可控的视频合成。Google DeepMind 的最新发布 Gemini Omni 代表了弥合推理与创作之间鸿沟的一次重大尝试。与以往主要专注于文本转视频生成的模型不同,Gemini Omni 被定位为一个多模态创意引擎,允许用户“从任何事物中创造任何事物”,并特别强调迭代式、对话式的视频编辑。
其核心在于,Gemini Omni 的设计初衷并非将视频视为一次性的输出,而是一个不断演进的项目。通过将 Gemini 的推理能力与先进的生成式视频工具相结合,它实现了一种工作流,用户可以逐步细化他们的构想,在改变环境、动作或美学风格等特定元素的同时,保持场景的一致性。
Gemini Omni 的核心能力
Gemini Omni 在 AI 如何与视频数据和用户意图进行交互方面引入了几项突破:
对话式迭代编辑
与其依赖单一、复杂的提示词来获得完美结果,Gemini Omni 允许进行自然的、多轮的对话。用户可以构建一个场景,然后对其进行微调——例如,通过改变摄像机角度或使某个物体变得不可见——而不会失去整个镜头的连贯性。这种“视频领域的 Nano Banana”方法将 AI 从一个生成器转变为一个协作编辑者。
多模态参考
Omni 最强大的功能之一是其能够将多种输入类型合成到单个输出中。用户可以提供:
- Images: 使用草图或照片作为结构或风格指南。
- Video: 将动作或视角从一个片段转移到新的角色或环境。
- Audio: 将视觉变化与音轨的节奏同步,或添加由特定屏幕动作触发的音效。
- Text: 指导复杂的叙事转变或添加同步的屏幕文本。
世界知识与物理学集成
DeepMind 声称,Gemini Omni 利用了对物理学(重力、流体动力学和动能)的直觉理解以及现实世界的知识(历史、科学和数学)来创建更可信的场景。这在从蛋白质折叠的粘土动画讲解视频到复杂的弹珠轨道模拟视频等示例中得到了展示。
技术批判与现实世界的局限性
虽然宣传材料展示了无缝的体验,但 Hacker News 上的技术社区对该模型的当前状态提出了几项关键质疑。
“物理”差距
尽管声称遵循现实世界的物理规律,但一些用户指出演示视频中存在明显的失败。一位观察者指出,在弹珠滚动视频中,弹珠偶尔会“无缘无故地跳起”或在没有能量来源的情况下加速。另一位专门从事刚体模拟的开发者指出,该模型在处理不连续物理现象时仍然存在困难,例如 Jenga 塔倒塌时,积木可能会在坍塌过程中发生变形或消失。
空间理解
批评者认为该模型缺乏深层的空间理解。一位用户指出,当物体移动到视线之外然后返回时,几何形状往往会发生变化,这表明该模型优先考虑的是“漂亮”的像素,而非对 3D 空间的结构化理解。这导致了一些建议,即训练方法可能过于宽泛,缺乏人类艺术家所采用的层级化学习(构图 $\rightarrow$ 透视 $\rightarrow$ 光影)。
性能与可访问性
早期采用者报告了在推广过程中遇到的显著摩擦,包括使用限制导致一些人甚至无法尝试该模型,以及由于着陆页上大量自动播放视频的使用而导致的浏览器崩溃。此外,一些用户在原始输出质量方面将 Gemini Omni Flash 与 Seedance 2.0 等竞争对手进行了不利的比较。
更广泛的影响:伦理与行业
Gemini Omni 等工具的出现引发了关于数字真实性与创意艺术未来的更广泛辩论。
"所以它真的很棒,而且我们有理由相信,视频中发生的任何事情都将不再可信。除非在某处有一个超级产品来验证素材的真实性?"
为了应对这一点,Google 已将 SynthID 数字水印和 C2PA Content Credentials 集成到 Omni 的输出中,以确保 AI 生成的内容可以被验证。然而,对于好莱坞的颠覆以及视觉艺术价值贬值的存在主义恐惧,仍然是观察者们反复讨论的主题。
结论
Gemini Omni 是迈向未来的一大步,即想象力与高保真视频之间的障碍几乎不存在。虽然它在多模态合成与对话式控制方面表现出色,,但它仍然面临生成式 AI 的经典障碍:维持严格的物理定律和真正的空间一致性。随着它从实验室突破转向 Google Flow 和 YouTube Shorts 中的创作者工具,其重点可能会从“它能否生成视频”转向“它能否维持一个世界的结构完整性”。