google-deepmind/representations4d

Foundation models for 4D spatial and temporal vision tasks.

解決する課題

このリポジトリは、空間(3D)と時間(1D)の次元を統合的に扱う4D表現として知られる、AIモデルが空間的・時間的情報をよりよく理解できるようにするための高度な動画および視覚表現のコレクションを提供します。カメラポーズ推定、オブジェクト追跡、深度推定などの非意味的タスクにおける自己教師学習のスケーラビリティの課題に対処しています。

動作方法

このプロジェクトは、動画表現学習に向けた複数の異なるアーキテクチャアプローチを実装しています:

  • 4D表現のスケーリング:トランスフォーマー動画モデルを用いたマスク付き自己符号化(MAE)により、空間的・時間的タスクにおける性能をスケーリングします。
  • Moving Off-the-Grid (MooG):クロスアテンションと位置埋め込みを活用し、潜在トークンが固定ピクセルグリッドに束縛されず、空間と時間の自由な移動を可能にすることで、より優れたオブジェクト中心の追跡を実現します。
  • 再帰的動画マスク付き自己符号化器(RVM):非対称なマスキング目的とピクセル再構成損失を用いる再帰的トランスフォーマーに基づくアプローチで、動画表現学習における高いパラメータ効率を達成します。
  • オムニボラス・ビジョンエンコーダ:DINOv2などのモデルに対して、事後訓練のレシピを提供し、同じシーンの異なる感覚的視点(例:RGBと深度マップ)間の特徴を一致させます。
  • GenCeption:事前に訓練された動画生成拡散バックボーン(WAN 2.1)を、テキスト指示に基づいてさまざまな視覚タスクを実行できる順伝播型の認識モデルに変換します。

対象ユーザー

コンピュータビジョン、動画理解、3Dシーン再構成に取り組む研究者および開発者で、下流の空間的・時間的タスクに高パフォーマンスな自己教師学習エンコーダやバックボーンが必要な方々です。

主な特徴

  • 大規模スケーリング:自己教師学習動画モデルのパラメータ数を20Mから22Bまでスケーリングすることを実証しました。
  • オブジェクト中心の追跡:MooGにより、トークンがピクセルではなく意味のあるオブジェクトに束縛されるようになります。
  • パラメータ効率:RVMは、蒸留を用いない他のモデルと比較して最大30倍のパラメータ効率を実現します。
  • 汎用的認識:GenCeptionにより、1つのモデルでテキストプロンプトを使って深度、表面法線、カメラポーズ推定を処理できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト