Google DeepMind Veo:将生成视频融入现场实拍电影制作《ANCESTRA》

Google DeepMind 与导演 Eliza McNitt 以及 Primordial Soup——由 Darren Aronofsky 创立的叙事创新企业——合作制作短片《ANCESTRA》。该项目展示了 Veo(Google 最先进的视频生成模型)与传统现场实拍电影制作的结合,能够创建原本成本高昂或技术上难以实现的复杂高保真序列。

AI 驱动的前期制作与概念艺术

为了奠定《ANCESTRA》的视觉基础,制作团队结合使用 Gemini、Imagen 和 Veo,将个人历史转化为电影画面。

  • Gemini 用于提示工程:团队将 McNitt 出生的个人照片上传至 Gemini,后者对图像进行精确的美学描述。这些描述作为后续图像和视频生成的主要提示。
  • Imagen 用于概念艺术:使用 Imagen 生成关键概念艺术,确定影片的整体氛围、风格和色彩调色板。
  • Veo 用于动画:将 Imagen 生成的概念艺术使用 Veo 进行动画化,并通过额外的文本提示引导特定动作和运动。

高级 Veo 功能用于电影级控制

为满足专业电影制作的需求,Google DeepMind 为 Veo 开发了新功能,以实现更高的个性化和对摄像机运动的精确控制。

个性化视频生成

为在各场景中保持一致的艺术指导——尤其是子宫内婴儿的画面——团队对 Imagen 模型进行微调,以匹配特定参考图像。随后使用 Gemini 精炼提示以获得逼真的图像,Veo 再通过其图像转视频功能将其转换为动画场景。此过程确保 AI 生成的主体在整部影片中保持视觉一致性。

运动匹配视频生成

Veo 被用于执行精确的摄像机运动,这些运动仅靠文本提示难以实现:

  • 虚拟摄像机追踪:在一段穿越人体进入子宫的序列中,团队创建了人体的 3D 模型,并使用虚拟摄像机记录了草稿镜头。Veo 追踪该草稿镜头的运动以生成最终视频。
  • 参考运动匹配:为表现有机孔洞闭合的过程,团队向 Veo 提供了该特定运动的参考视频。Veo 将这些参考运动与文本提示相结合,在数分钟内生成全新高质量场景,绕过传统 CGI 的复杂且耗时的制作过程。

将生成视频与现场实拍画面融合

为避免常见于 VFX 婴儿的“恐怖谷”效应,制作团队将现场实拍表演与生成元素相结合:

  • 对象添加:利用 Veo 的“添加对象”功能,团队在现场实拍画面中插入了生成的新生婴儿。通过向 Veo 提供原始画面、文本提示以及婴儿的指定区域,模型生成了该主体,同时保持其余场景的一致性。
  • VFX 整合:随后使用传统 VFX 与调色对这些生成元素进行精细化处理,确保 AI 生成的婴儿与现场实拍环境无缝融合。

与传统 VFX 流程的整合

生成式 AI 并未取代传统工作流程,而是作为补充工具。对于复杂镜头——例如日落时从孵化中的鳄鱼蛋内部的主观视角镜头——团队使用 Veo 和 Imagen 生成了多张单独的图像和视频,然后通过传统 VFX 合成技术将其组合。

Google DeepMind 与 Primordial Soup 的此次合作是计划中的三部影片的第一部,旨在确保生成式 AI 工具的开发基于专业电影制作者的实际需求和工作流程。

Sources