Atlas: 空間智能的世界模型

World Labs 推出了 Atlas,這是一款旨在實現「空間智能」的新一代世界模型。Atlas 是一個多模態自回歸擴散 Transformer,從零開始預訓練,能夠原生處理文本、圖像、影片和 3D 數據。透過將這些輸入整合到共享的空間上下文中,Atlas 可以生成一致的 3D 環境、從稀疏圖像重建真實世界場景,並為機器人技術和 VFX 提供複雜的時空動態模擬。

原生空間控制與相機驅動生成

Atlas 透過使用精確的相機幾何作為原生輸入類型,而非依賴粗略的文本描述,實現了像素級的相機控制。這讓使用者能夠指定確切的相機位置和角度,以生成場景的新視角。

  • 單圖外推 (Single-Image Extrapolation):從單張輸入圖像,Atlas 可以想像場景的其餘部分,在保持幾何一致性的同時,從任何角度生成視角。
  • 空間上下文管理 (Spatial Context Management):Atlas 將輸入編碼為基於 3D 的空間上下文。使用者可以將不相關的參考圖像放置在 3D 空間中,模型將生成一個在它們之間平滑插值的世界,想像出如走廊或門戶般的過渡場景。
  • 長篇影片 (Long-Form Video):透過將手工設計的相機路徑與空間上下文結合,Atlas 可以生成解析度達 1440p、長度可達一分鐘的連貫影片。

高保真空間重建

Atlas 解決了從稀疏輸入進行新視角合成的基本電腦視覺問題。它可以使用僅僅兩到三張圖像重建真實世界空間,其表現通常優於專門的 3D 重建模型。

  • 稀疏到密集重建 (Sparse-to-Dense Reconstruction):模型可以利用其預訓練的世界知識來填補場景中數據缺失的部分。隨著輸入圖像增加,模型會從想像合理的填充內容轉向提供忠實且精確的重建。
  • 顯式 3D 輸出 (Explicit 3D Outputs):除了 2D 幀,Atlas 還能原生生成 3D 深度圖。這使得模型可以將世界輸出為點雲或 3D Gaussian splats,讓重建的環境可用於遊戲、設計和 VFX 工作流程。

機器人技術與 VFX 的時空模擬

Atlas 作為一個世界模擬器,模擬環境如何隨時間演變。這種能力對於機器人技術中的「Real-to-Sim」工作流程特別有用。

  • 機器人模擬 (Robotics Simulation):Atlas 可以從手機影片中重建一個空間,然後生成機器人在導航該空間時,其感測器會觀察到的 RGB 和深度數據。這有助於在不需要昂貴的 LiDAR 或專業捕捉設備的情況下,為機器人導航和操作提供多樣化的訓練數據。
  • 影片重構 (Video Reframing):Atlas 可以將幾張普通的相機視角轉化為「子彈時間 (bullet time)」效果,讓使用者能夠凍結時間並使用僅僅三部手機的素材來從不可能的角度重新構圖。

技術架構:多模態自回歸擴散 Transformer

Atlas 脫離了標準的 LLM 或影片模型架構,以優先考慮空間控制。其架構由四個關鍵屬性定義:

  1. 多模態 (Multimodal):它原生處理文本、圖像、相機姿態 (camera poses) 和 3D 深度圖。
  2. 自回歸 (Autoregressive):它逐一生成序列元素,使其能夠透過將各種任務視為不同的序列類型來適應各種任務。
  3. 擴散 (Diffusion):作為一個 rectified flow 模型,它透過逐漸去噪來生成輸出,從而實現推理速度與品質之間的權衡。
  4. Transformer:它使用 Transformer 主幹架構以確保可擴展性並與現代硬體加速(例如 KV-caching)相容。

性能與擴展性

World Labs 報告稱,Atlas 在相機條件生成與 3D 重建方面均優於於專門化模型。在相機控制生成的真人評估試驗中,Atlas 展現了顯著優於近期影片模型的優勢,特別是在相機軌跡變得複雜時。在 3D 重建基準測試中,Atlas 的誤差率比目前最好的專門化開源重建模型更低。

World Labs 表示,模型的性能會隨著訓練計算量的增加而持續提升,這表明擴展 (scaling) 將繼續推動能力的提升。

社群洞察與反對觀點

技術用戶之間的討論突顯了當前世界模型方法的潛力與局限性:

"What does have obvious value is the latent knowledge that the model could have used to generate those synthetic views... the fact that Atlas is capable of identifying regions of the input images that look like 'floors'... suggests that it has a concept of 'floor-like walkability' which it could have learned."

其他用戶指出在動態場景中可能存在時間一致性與幻覺問題,特別是:

"I can see things appearing and disappearing (aka inconsistent hallucinations). See the dominos falling scene, it is easy to see dominos appearing and disappearing into thin air."

此外,一些開發者表示需要結構化的場景原語 (scene primitives) 而非僅僅是 meshes 或 splats,並指出對於 CAD 應用程式,使用者需要的是可以進行尺寸標註的參數化表面,而不僅僅是視覺重建。

Sources

相關

  • Dispatch
  • 專案
  • 專案
  • Dispatch
  • Dispatch