facebookresearch/vggt-omega

[CVPR 2026 Oral] VGGT Omega

何を解決するか

VGGT-Ωは、画像のセットからカメラの姿勢と深度を推定する方法を提供し、2次元の視覚データから3次元シーンを再構築可能にします。

動作方法

このプロジェクトは、事前学習済みのトランスフォーマー型モデル(1Bパラメータバージョンあり)を使用しており、画像を入力として受け取り、姿勢エンコーディング、深度マップ、深度信頼度を予測します。これらの予測結果は、カメラの外部パラメータと内部パラメータに変換され、3次元点群を生成し、GLBファイルとしてシーンを可視化します。

対象ユーザー

コンピュータビジョン、3次元再構築、空間AIに取り組む研究者や開発者向けに設計されています。

特徴

  • エンドツーエンドの推論: 画像からカメラパラメータと深度を両方予測可能。
  • テキスト同期サポート: テキスト同期された埋め込み用の特別なチェックポイントを提供。
  • 3次元可視化: 深度を再投影しない点群と予測されたカメラをGLBシーンとして可視化するGradioデモを含む。
  • メモリ使用量のスケーラビリティ: 入力フレーム数の変化に応じたGPUメモリ使用量の詳細なベンチマークを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト