facebookresearch/boxer
Code for the Boxer research paper
何を解決するか
Boxerは、オープンワールド環境下で画像からの2Dオブジェクト検出(バウンディングボックス)を正確な3Dオrientedバウンディングボックス(OBB)に「引き上げる」課題に対処します。特に室内オブジェクト検出に焦点を当てており、ポーズ付き画像と準密な点群のみを使用して、3D空間におけるオブジェクトを識別できるようにします。
動作方法
Boxerは2D検出と3D推定を組み合わせたパイプラインを使用します。OWLv2を用いてオープンボリュームの2D検出(テキストプロンプトで特定のオブジェクトを指定可能)を行い、BoxerNetと呼ばれるモデルでこれらの2Dボックスを3Dに変換します。システムは単一画像または動画シーケンスを処理でき、カメラの内部パラメータ、6自由度のポーズ、重力方向を活用してボックスの方向を正しく設定します。また、時間的一貫性を保つためのオンライン3Dトラッキングと、複数の検出を統合して静的なグローバルマップを生成するオフライン3D融合もサポートしています。
対象ユーザー
コンピュータビジョン、ロボティクス、室内シーン理解の分野で作業する研究者や開発者向けです。2D画像検出を空間的に正確な3Dオブジェクトの位置と向きに変換する必要がある方々に最適です。
特徴
- オープンボリューム検出: OWLv2を統合し、任意のテキストプロンプトに基づいてオブジェクトを検出可能。
- 堅牢な3D引き上げ: 2Dバウンディングボックスを3Dオrientedバウンディングボックス(OBB)に変換。
- 時間的一貫性: オンライントラッカーにより、動画フレーム間でのオブジェクトの同一性を維持。
- グローバル融合: 後処理融合により、複数視点からの検出を統合して静的なグローバルマップを生成。
- 広範なデータセット対応: Project Aria、CA-1M、SUN-RGBD、ScanNetデータと互換性あり。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト