Project Genie:Google DeepMind 的互動世界模型原型

Google DeepMind 已發布 Project Genie,這是一個實驗性研究原型,使用戶能夠建立並探索即時生成的互動世界。此工具目前僅對美國的 Google AI Ultra 訂閱者(年滿 18 歲)開放。

透過 Genie 3 的即時世界模擬

Project Genie 由 Genie 3 世界模型驅動,該模型模擬環境的動態並預測行動對環境狀態的影響。與靜態的 3D 快照不同,Genie 3 會在使用者移動並與世界互動時即時產生前方的路徑。

此功能允許模擬各種情境,包括:

  • 機器人模擬
  • 動畫與小說建模
  • 歷史場景與特定地點的探索

Project Genie 的核心功能

Project Genie 是一個整合了 Genie 3、Nano Banana Pro 與 Gemini 的網頁應用程式,提供三大主要使用者功能:

1. 世界草圖繪製

使用者可透過文字提示、生成的圖像或上傳的圖像來建立活生生、可擴展的環境。此功能允許使用者定義角色與探索方式(例如步行、騎乘、飛行或駕駛)。

與 Nano Banana Pro 的整合實現了「世界草圖繪製」,使用者可以預覽並修改圖像,以微調世界外觀,並在進入環境前選擇角色視角(第一人稱或第三人稱)。

2. 世界探索

Project Genie 會根據使用者的操作即時生成可導航的環境。使用者可以在生成的空間中移動,並在移動過程中調整相機視角。

3. 世界重混

使用者可以在既有提示的基礎上進行重混,將世界重新詮釋為全新版本。平台提供精選世界畫廊與隨機圖示以激發靈感。使用者亦可下載探索過程與創建世界的影片。

目前的限制與負責任的開發

作為早期研究原型,Project Genie 及其底層的 Genie 3 模型仍有多項已知限制:

  • 視覺與物理真實度:生成的世界可能不總是逼真,或未必完全符合提示、圖像或現實物理規則。
  • 控制與延遲:角色有時會出現較低的可控性或對使用者輸入的回應延遲較高。
  • 時長:生成內容目前限制為 60 秒。
  • 功能缺口:八月公布的某些功能(例如在探索過程中可觸發改變世界的事件)尚未納入此原型。

Google DeepMind 表示,此次發布的目標是更好地了解世界模型在 AI 研究與生成媒體中的使用方式。

Sources