facebookresearch/vggt-omega
[CVPR 2026 Oral] VGGT Omega
何を解決するか
VGGT-Ωは、画像のセットからカメラの姿勢と深度を推定する方法を提供し、2次元の視覚データから3次元シーンを再構築可能にします。
動作方法
このプロジェクトは、事前学習済みのトランスフォーマー型モデル(1Bパラメータバージョンあり)を使用しており、画像を入力として受け取り、姿勢エンコーディング、深度マップ、深度信頼度を予測します。これらの予測結果は、カメラの外部パラメータと内部パラメータに変換され、3次元点群を生成し、GLBファイルとしてシーンを可視化します。
対象ユーザー
コンピュータビジョン、3次元再構築、空間AIに取り組む研究者や開発者向けに設計されています。
特徴
- エンドツーエンドの推論: 画像からカメラパラメータと深度を両方予測可能。
- テキスト同期サポート: テキスト同期された埋め込み用の特別なチェックポイントを提供。
- 3次元可視化: 深度を再投影しない点群と予測されたカメラをGLBシーンとして可視化するGradioデモを含む。
- メモリ使用量のスケーラビリティ: 入力フレーム数の変化に応じたGPUメモリ使用量の詳細なベンチマークを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト