D4RT:動態 4D 重建與追蹤

Google DeepMind 推出 D4RT(Dynamic 4D Reconstruction and Tracking),一個統一的 AI 模型,旨在從 2D 影片輸入中重建與追蹤跨越空間與時間的動態場景。透過將動態場景重建統一於單一框架,D4RT 能夠完整感知動態現實,克服以往恢復運動中體積 3D 世界所需的碎片化且計算密集的流程。

統一查詢式架構

D4RT 採用統一的編碼器-解碼器 Transformer 架構,解決從 2D 投影恢復 3D 動作的逆問題。系統透過彈性的查詢機制運作,使模型僅根據一個根本問題計算必要的資料:『給定影片中的某個像素在任意時間、從選定相機觀點看,其在 3D 空間中的位置是什麼?』

Key technical components include:

  • Encoder:將輸入影片處理為場景幾何與動作的壓縮表示。
  • Lightweight Decoder:查詢編碼器的表示,以在現代 AI 硬體上平行回應特定的時空查詢。

此方法使 D4RT 具備極高的可擴展性與速度,無論是追蹤單一點還是重建整個場景皆能快速完成。

效能與基準測試

D4RT 在精度與效率上相較於先前的最先進方法顯著提升,在某些測試中快了 18 倍至 300 倍。舉例而言,D4RT 在單顆 TPU 晶片上將一分鐘的影片處理約五秒鐘,而先前的方法需十分鐘(提升 120 倍)。

Across several benchmarks, D4RT achieved leading results:

  • Point Cloud Reconstruction (MPI Sintel):D4RT 獲得 3D Fidelity 分數 1.091,優於 $\pi3$(0.861)與 SpatialTrackerV2(0.625)等基線。
  • 3D Point Tracking (Aria Digital Twin):D4RT 獲得 3D Fidelity 分數 1.904,超過 SpatialTrackerV2(1.762)與 CoTracker3 + VGGT(1.264)。
  • Camera Pose Estimation (RE10k):D4RT 獲得最高的 Pose AUC 分數 0.835,勝過 $\pi3$(0.787)與 SpatialTrackerV2(0.757)。

核心能力

透過其彈性的查詢式介面,D4RT 能夠解決多樣的 4D 任務,無需額外的專門模型:

  • Point Tracking:預測像素在時間步驟中的 3D 軌跡,即使物體在某些畫面中不可見。
  • Point Cloud Reconstruction:透過凍結時間與相機視角,生成場景完整的 3D 結構,省去迭代優化或額外相機估計的需求。
  • Point Cloud Reconstruction:透過凍結時間與相機視角,生成場景完整的 3D 結構,省去迭代優化或額外相機估計的需求。
  • Camera Pose Estimation:透過對齊不同視角下單一時刻的 3D 快照,恢復相機的軌跡。

下游應用

DeepMind 確認了三個主要領域,可應用 D4RT 的即時 4D 重建能力:

  • Robotics:提供在有移動人物與物體的環境中安全導航與靈巧操作所需的空間感知。
  • Augmented Reality (AR):實現低延遲、裝置端的場景幾何理解,將數位物件精確覆蓋於現實世界。
  • World Models:透過分離相機運動、物體運動與靜態幾何,促進具備真實物理世界模型的 AI 發展。

Sources