Genie 3 實時世界模型發布
TL;DR
Genie 3 是 DeepMind 最新的通用世界模型,能即時生成細節豐富、可互動的 3D 環境(24 fps、720p),並在數分鐘內保持視覺一致性,為具身 AI 研究與生成式媒體開啟新可能。
Genie 3 是什麼?
Genie 3 是一個基礎世界模型,基於 DeepMind 先前的 Genie 1 與 Genie 2 系統進行擴展。它可根據自然語言提示創建可互動的世界,讓使用者以 24 fps、720p 解析度進行導航。與先前的模型不同,Genie 3 支援即時控制、長時間範圍的一致性,以及更廣泛的物理與視覺現象。
技術進展
即時畫面生成
- 模型以自回歸方式生成每一幀,並以完整的過去軌跡作為條件,使導航具備即時回應能力。
- 計算每秒多次執行,以納入新的使用者輸入,實現流暢的 24 fps 播放。
長時間範圍環境一致性
- Genie 3 能保留長達一分鐘的視覺記憶,防止自回歸影片生成常見的漂移問題。
- 一致性在以下範例中得以展示:房屋粉刷任務、帶有傳送門的維多利亞街道,以及對古雅典的多分鐘探索,靜態元素(例如樹木)保持穩定。
物理屬性建模
- 模型以寫實的動態模擬水、光照、熔岩流、風以及其他自然現象。
- 示例提示展示了火山地形導航、颶風影響的人行道以及深海水母的移動。
多元內容生成
- 自然生態系統 – 森林、冰川湖泊與海洋環境,具備可信的植物與動物。
- 虛構動畫 – 風格化的生物、超現實的景觀與戲劇性的顛覆世界事件。
- 歷史與地理場景 – 逼真的阿爾卑斯山、威尼斯運河、克諾索斯宮以及伊利諾伊州的現代街道重建。
展示的能力
| 能力 | 範例提示 | 觀察 |
|---|---|---|
| 物理模擬 | 火山地形與熔岩池 | 實寫的粒子效果與地形互動。 |
| 生態系統生成 | 冰川湖泊與野生動物 | 動物行為與植被的協調一致。 |
| 虛構動畫 | 彩虹橋上的毛茸茸生物 | 風格化且高細節的角色動畫。 |
| 歷史重建 | 克諾索斯宮的鼎盛時期 | 合理的建築細節。 |
| 可提示的世界事件 | 透過文字改變天氣或新增物件 | 即時的世界變更,無需重新渲染。 |
具身代理研究
Genie 3 作為測試平台,用於訓練如 DeepMind 的 SIMA 2 等代理。代理向模型發出導航指令,模型再渲染出相應的世界狀態。由於 Genie 3 能在較長的動作序列中保持一致性,代理可以追求更複雜的多步目標,使我們更接近於在開放式課程中訓練代理。
限制
- 行動空間 – 直接的代理行動受限;許多世界變更仍需文字提示,而非具身互動。
- 多代理動態 – 模擬多個獨立代理之間的互動仍是一項未解決的挑戰。
- 地理真實性 – 現實世界位置僅為近似,缺乏精確的地理準確度。
- 文字渲染 – 生成的文字通常只有在提示中明確包含時才可辨識。
- 互動時長 – 目前的持續互動僅限於數分鐘,無法達到數小時。
負責任的部署
DeepMind 正以有限的研究預覽方式向少數學者與創作者釋出 Genie 3。此分階段的推出旨在收集關於安全、濫用可能性與社會影響的回饋,同時負責任開發與創新團隊致力於風險緩解策略。
未來方向
- 擴大測試者群體的使用範圍,最終向公眾開放。
- 延長互動時長與行動空間,以支援更豐富的具身任務。
- 提升地理精確度與多代理模擬。
- 探索在機器人與自主系統領域的教育、訓練與評估應用。
引用
若要引用 Genie 3,請使用以下提供的 BibTeX 條目:
@article{genie32025,
title={Genie 3: A new frontier for world models},
author={Ball, Phil and Bauer, Jakob and ... and Zubov, Vadim},
journal={DeepMind Blog},
year={2025},
url={https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/}
}