Project Genie:Google DeepMind 的互動世界模型原型
Google DeepMind 已發布 Project Genie,這是一個實驗性研究原型,使用戶能夠建立並探索即時生成的互動世界。此工具目前僅對美國的 Google AI Ultra 訂閱者(年滿 18 歲)開放。
透過 Genie 3 的即時世界模擬
Project Genie 由 Genie 3 世界模型驅動,該模型模擬環境的動態並預測行動對環境狀態的影響。與靜態的 3D 快照不同,Genie 3 會在使用者移動並與世界互動時即時產生前方的路徑。
此功能允許模擬各種情境,包括:
- 機器人模擬
- 動畫與小說建模
- 歷史場景與特定地點的探索
Project Genie 的核心功能
Project Genie 是一個整合了 Genie 3、Nano Banana Pro 與 Gemini 的網頁應用程式,提供三大主要使用者功能:
1. 世界草圖繪製
使用者可透過文字提示、生成的圖像或上傳的圖像來建立活生生、可擴展的環境。此功能允許使用者定義角色與探索方式(例如步行、騎乘、飛行或駕駛)。
與 Nano Banana Pro 的整合實現了「世界草圖繪製」,使用者可以預覽並修改圖像,以微調世界外觀,並在進入環境前選擇角色視角(第一人稱或第三人稱)。
2. 世界探索
Project Genie 會根據使用者的操作即時生成可導航的環境。使用者可以在生成的空間中移動,並在移動過程中調整相機視角。
3. 世界重混
使用者可以在既有提示的基礎上進行重混,將世界重新詮釋為全新版本。平台提供精選世界畫廊與隨機圖示以激發靈感。使用者亦可下載探索過程與創建世界的影片。
目前的限制與負責任的開發
作為早期研究原型,Project Genie 及其底層的 Genie 3 模型仍有多項已知限制:
- 視覺與物理真實度:生成的世界可能不總是逼真,或未必完全符合提示、圖像或現實物理規則。
- 控制與延遲:角色有時會出現較低的可控性或對使用者輸入的回應延遲較高。
- 時長:生成內容目前限制為 60 秒。
- 功能缺口:八月公布的某些功能(例如在探索過程中可觸發改變世界的事件)尚未納入此原型。
Google DeepMind 表示,此次發布的目標是更好地了解世界模型在 AI 研究與生成媒體中的使用方式。