D4RT: 動的4D再構成とトラッキング

Google DeepMindは、D4RT(動的4D再構成とトラッキング)を導入しました。これは、2Dビデオ入力から空間と時間をまたがる動的シーンを再構成およびトラッキングするように設計された統合AIモデルです。動的シーン再構成を単一のフレームワークに統合することにより、D4RTは動的現実の全体的な認識を可能にし、運動中のボリューム的3D世界を復元するために通常必要とされる断片的で計算量の多いプロセスを克服します。

統一クエリベースアーキテクチャ

D4RTは、統合されたエンコーダー-デコーダーTransformerアーキテクチャを使用して、2D投影から3D運動を復元する逆問題を解決します。システムは、基本的な質問「選択されたカメラから見た任意の時間における3D空間での、ビデオの特定のピクセルの位置はどこか?」に基づいて、必要なデータのみを計算できる柔軟なクエリメカニズムを通じて動作します。

主要な技術コンポーネントには次のものがあります:

  • Encoder: 入力ビデオをシーンの幾何学と運動の圧縮表現に処理します。
  • Lightweight Decoder: エンコーダーの表現をクエリし、最新のAIハードウェア上で特定の空間時間クエリに対して並列に回答します。

このアプローチにより、D4RTは個々のポイントをトラッキングするか、全体のシーンを再構成するかにかかわらず、極めてスケーラブルで高速になります。

パフォーマンスとベンチマーク

D4RTは、以前の最先端手法と比較して精度と効率の両方で大幅な改善を示し、特定のテストでは18倍から300倍高速になります。例えば、D4RTは単一のTPUチップで1分のビデオを約5秒で処理し、従来の方法では10分かかっていたのに対し(120倍の改善)です。

いくつかのベンチマークにおいて、D4RTは以下のような先進的な結果を達成しました:

  • Point Cloud Reconstruction (MPI Sintel): D4RTは3D忠実度スコア1.091を達成し、ベースラインである$\pi3$(0.861)やSpatialTrackerV2(0.625)を上回りました。
  • 3D Point Tracking (Aria Digital Twin): D4RTは3D忠実度スコア1.904に到達し、SpatialTrackerV2(1.762)およびCoTracker3 + VGGT(1.264)を上回りました。
  • Camera Pose Estimation (RE10k): D4RTは最高のPose AUCスコア0.835を達成し、$\pi3$(0.787)およびSpatialTrackerV2(0.757)を上回りました。

コア機能

柔軟なクエリベースインターフェースを通じて、D4RTは別途専門モデルを必要とせずに幅広い4Dタスクを解決できます:

  • Point Tracking: オブジェクトがすべてのフレームで見えなくても、時間ステップをまたがるピクセルの3D軌道を予測します。
  • Point Cloud Reconstruction: 時間とカメラ視点を固定することで、シーンの完全な3D構造を生成し、反復最適化や別途のカメラ推定の必要性をなくします。
  • Point Cloud Reconstruction: 時間とカメラ視点を固定することで、シーンの完全な3D構造を生成し、反復最適化や別途のカメラ推定の必要性をなくします。
  • Camera Pose Estimation: 異なる視点からの単一瞬間の3Dスナップショットを整合させることで、カメラの軌道を復元します。

ダウンストリームアプリケーション

DeepMindは、D4RTのリアルタイム4D再構成機能が適用できる3つの主要な分野を特定しています:

  • Robotics: 動く人や物がある環境での安全なナビゲーションと器用な操作に必要な空間認識を提供します。
  • Augmented Reality (AR): 低遅延のオンデバイスでのシーン幾何学の理解を可能にし、デジタルオブジェクトを現実世界に正確にオーバーレイします。
  • World Models: カメラ運動、物体運動、静止幾何学を分離することで、物理現実の真のワールドモデルを持つAIの開発に貢献します。

Sources