Google DeepMind Veo:生成ビデオを実写映画制作に統合する(ANCESTRA向け)

Google DeepMindは監督エリザ・マクニットと、ダーレン・アロノフスキーが設立したストーリーテリングイノベーションベンチャーであるPrimordial Soupと提携し、短編映画「ANCESTRA」を制作しました。このプロジェクトは、Googleの最先端ビデオ生成モデルであるVeoを従来の実写映画制作と統合し、そうでなければ費用が過大になるか技術的に困難な、複雑で高忠実度のシーンを実現することを示しています。

AI主導のプリプロダクションとコンセプトアート

「ANCESTRA」のビジュアル基盤を構築するため、制作チームはGemini、Imagen、Veoの組み合わせを用いて個人の歴史をシネマティックなイメージに変換しました。

  • Gemini(プロンプトエンジニアリング用): チームはマクニットの出生時の個人写真をGeminiにアップロードし、画像を正確な美的詳細で記述させました。これらの記述は、後続の画像およびビデオ生成の主要なプロンプトとして使用されました。
  • Imagen(コンセプトアート用): Imagenは、映画全体のムード、スタイル、カラーパレットを定義する主要なコンセプトアートを生成するために使用されました。
  • Veo(アニメーション用): Imagenで生成されたコンセプトアートは、Veoを使用してアニメーション化され、追加のテキストプロンプトで特定のアクションや動きを指示しました。

シネマティックコントロールのための高度なVeo機能

プロフェッショナルな映画制作の要件を満たすため、Google DeepMindはVeoに新たな機能を開発し、パーソナライズとカメラモーションの精密な制御を可能にしました。

パーソナライズド・ビデオ生成

シーン全体で一貫したアートディレクションを保つため—特に子宮内の赤ちゃんの映像において—チームは特定の参照画像に合わせてImagenモデルをファインチューニングしました。その後、Geminiを使用してリアルなイメージのプロンプトを洗練させ、Veoは画像からビデオへの機能でそれらをアニメーションシーンに変換しました。このプロセスにより、AI生成された対象が映画全体で視覚的に一貫性を保ちました。

モーションマッチングビデオ生成

Veoは、テキストプロンプトだけでは実現が難しい精密なカメラ動作を実行するために活用されました:

  • バーチャルカメラトラッキング: 人体を通って子宮へ向かうシークエンスのため、チームは人体の3Dモデルを作成し、バーチャルカメラでドラフトショットを記録しました。Veoはこのドラフトショットの動きを追跡し、最終ビデオを生成しました。
  • リファレンスモーションマッチング: 有機的な穴が閉じる様子を描くため、チームはその特定の動きのリファレンス動画をVeoに提供しました。Veoはこれらのリファレンスモーションとテキストプロンプトを組み合わせ、数分で新しい高品質シーンを生成し、従来のCGIの複雑で時間のかかる工程を回避しました。

生成ビデオと実写映像のブレンド

VFXベビーにしばしば見られる「不気味の谷」を回避するため、制作チームは実写パフォーマンスと生成要素を組み合わせました:

  • オブジェクト追加: Veoの「オブジェクト追加」機能を使用して、チームは生成された新生児を実写映像に挿入しました。元の映像、テキストプロンプト、赤ちゃんの位置を指定することで、モデルは対象を生成しつつシーンの他部分を一貫させました。
  • VFX統合: 生成された要素は、従来のVFXとカラーグレーディングで調整され、AI生成の赤ちゃんと実写環境とのシームレスな融合が実現されました。

従来のVFXパイプラインとの統合

生成AIは従来のワークフローの代替ではなく、補完的なツールとして使用されました。複雑なショット(例:夕暮れ時に孵化中のワニの卵内部からの視点ショット)の場合、チームはVeoとImagenを用いて複数の個別画像やビデオを生成し、従来のVFXコンポジット技術で合成しました。

このパートナーシップは、計画された3本の映画のうち最初の作品であり、生成AIツールがプロの映画制作者の実際のニーズとワークフローに基づいて開発されることを目指しています。

Sources