Genie 3 實時世界模型發布

TL;DR

Genie 3 是 DeepMind 最新的通用世界模型,能即時生成細節豐富、可互動的 3D 環境(24 fps、720p),並在數分鐘內保持視覺一致性,為具身 AI 研究與生成式媒體開啟新可能。

Genie 3 是什麼?

Genie 3 是一個基礎世界模型,基於 DeepMind 先前的 Genie 1 與 Genie 2 系統進行擴展。它可根據自然語言提示創建可互動的世界,讓使用者以 24 fps、720p 解析度進行導航。與先前的模型不同,Genie 3 支援即時控制、長時間範圍的一致性,以及更廣泛的物理與視覺現象。

技術進展

即時畫面生成

  • 模型以自回歸方式生成每一幀,並以完整的過去軌跡作為條件,使導航具備即時回應能力。
  • 計算每秒多次執行,以納入新的使用者輸入,實現流暢的 24 fps 播放。

長時間範圍環境一致性

  • Genie 3 能保留長達一分鐘的視覺記憶,防止自回歸影片生成常見的漂移問題。
  • 一致性在以下範例中得以展示:房屋粉刷任務、帶有傳送門的維多利亞街道,以及對古雅典的多分鐘探索,靜態元素(例如樹木)保持穩定。

物理屬性建模

  • 模型以寫實的動態模擬水、光照、熔岩流、風以及其他自然現象。
  • 示例提示展示了火山地形導航、颶風影響的人行道以及深海水母的移動。

多元內容生成

  • 自然生態系統 – 森林、冰川湖泊與海洋環境,具備可信的植物與動物。
  • 虛構動畫 – 風格化的生物、超現實的景觀與戲劇性的顛覆世界事件。
  • 歷史與地理場景 – 逼真的阿爾卑斯山、威尼斯運河、克諾索斯宮以及伊利諾伊州的現代街道重建。

展示的能力

能力 範例提示 觀察
物理模擬 火山地形與熔岩池 實寫的粒子效果與地形互動。
生態系統生成 冰川湖泊與野生動物 動物行為與植被的協調一致。
虛構動畫 彩虹橋上的毛茸茸生物 風格化且高細節的角色動畫。
歷史重建 克諾索斯宮的鼎盛時期 合理的建築細節。
可提示的世界事件 透過文字改變天氣或新增物件 即時的世界變更,無需重新渲染。

具身代理研究

Genie 3 作為測試平台,用於訓練如 DeepMind 的 SIMA 2 等代理。代理向模型發出導航指令,模型再渲染出相應的世界狀態。由於 Genie 3 能在較長的動作序列中保持一致性,代理可以追求更複雜的多步目標,使我們更接近於在開放式課程中訓練代理。

限制

  • 行動空間 – 直接的代理行動受限;許多世界變更仍需文字提示,而非具身互動。
  • 多代理動態 – 模擬多個獨立代理之間的互動仍是一項未解決的挑戰。
  • 地理真實性 – 現實世界位置僅為近似,缺乏精確的地理準確度。
  • 文字渲染 – 生成的文字通常只有在提示中明確包含時才可辨識。
  • 互動時長 – 目前的持續互動僅限於數分鐘,無法達到數小時。

負責任的部署

DeepMind 正以有限的研究預覽方式向少數學者與創作者釋出 Genie 3。此分階段的推出旨在收集關於安全、濫用可能性與社會影響的回饋,同時負責任開發與創新團隊致力於風險緩解策略。

未來方向

  • 擴大測試者群體的使用範圍,最終向公眾開放。
  • 延長互動時長與行動空間,以支援更豐富的具身任務。
  • 提升地理精確度與多代理模擬。
  • 探索在機器人與自主系統領域的教育、訓練與評估應用。

引用

若要引用 Genie 3,請使用以下提供的 BibTeX 條目:

@article{genie32025,
  title={Genie 3: A new frontier for world models},
  author={Ball, Phil and Bauer, Jakob and ... and Zubov, Vadim},
  journal={DeepMind Blog},
  year={2025},
  url={https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/}
}

Sources