Project Genie: Google DeepMind のインタラクティブなワールドモデルプロトタイプ

Google DeepMind は、Project Genie という実験的研究プロトタイプをリリースしました。これにより、ユーザーはインタラクティブでリアルタイムに生成された世界を作成し、探索できるようになります。このツールは現在、米国の Google AI Ultra 加盟者(18 歳以上)向けに提供されています。

Genie 3 によるリアルタイムワールドシミュレーション

Project Genie は Genie 3 ワールドモデルを搭載しており、環境のダイナミクスをシミュレートし、行動が環境の状態に与える影響を予測します。静的な 3D スナップショットとは異なり、Genie 3 はユーザーが移動し世界と相互作用するたびに、リアルタイムで先行するパスを生成します。

この機能により、以下のような多様なシナリオのシミュレーションが可能です:

  • ロボティクスシミュレーション
  • アニメーションおよびフィクションのモデリング
  • 歴史的設定や特定の場所の探索

Project Genie のコア機能

Project Genie はウェブアプリケーションで、Genie 3、Nano Banana Pro、Gemini を統合し、ユーザーに主に次の 3 つの機能を提供します。

1. ワールドスケッチ

ユーザーはテキスト、生成された画像、またはアップロードした画像でプロンプトを提供することで、生命ある拡張環境を作成できます。この機能により、キャラクターや探索方法(例: 歩行、乗車、飛行、運転)を定義できます。

Nano Banana Pro との統合により World Sketching が可能になり、ユーザーは画像をプレビュー・修正して世界の外観を微調整し、環境に入る前にキャラクター視点(第一人称または第三人称)を選択できます。

2. ワールドエクスプロレーション

Project Genie はユーザーの操作に基づき、リアルタイムでナビゲート可能な環境を生成します。ユーザーは生成された空間を移動しながら、カメラ視点を調整できます。

3. ワールドリミックス

ユーザーは既存のプロンプトを基に世界を再構築し、新たな解釈を作り出せます。プラットフォームにはキュレーションされたワールドのギャラリーとインスピレーション用のランダマイザーアイコンが用意されています。さらに、探索や作成した世界の動画をダウンロードするオプションもあります。

現在の制限事項と責任ある開発

初期の研究プロトタイプとして、Project Genie と基盤となる Genie 3 モデルには以下の既知の制限があります:

  • 視覚的・物理的忠実度: 生成された世界は必ずしも実写に近い外観や、プロンプト・画像・実世界の物理法則に完全に従うわけではありません。
  • 制御性とレイテンシ: キャラクターがユーザー入力に対して制御しにくかったり、応答遅延が大きくなることがあります。
  • 継続時間: 生成は現在 60 秒に制限されています。
  • 機能ギャップ: 8 月に発表された、探索中に世界を変化させるプロンプト可能なイベントなど、一部機能はまだプロトタイプに含まれていません。

Google DeepMind は、本リリースの目的は、ワールドモデルが AI 研究や生成メディアでどのように活用されるかをより深く理解することにあると述べています。

Sources