MIT-SPARK/VGGT-SLAM
VGGT-SLAM: Dense RGB SLAM Optimized on the SL(4) Manifold
What it solves
VGGT-SLAM は、リアルタイムかつ高密度なシーン再構成とマッピングを可能にします。システムが移動しながら環境の詳細な 3D マップを作成し、同時に自己位置を推定します (SLAM - Simultaneous Localization and Mapping)。
How it works
本システムは、高密度再構成のためにフィードフォワード方式を採用しています。以下のコンポーネントを統合して、段階的にマップを作成します:
- Perception Encoder と SAM 3 を使用して、オプションのオープンセット3D物体検出を行います。これにより、ユーザーは特定の物体 (例: 「coffee machine」) をクエリし、マップ上での 3D バウンディングボックスによるハイライト表示が可能です。
- 画像フォルダのオフライン処理と、RealSense カメラを使用したリアルタイムのオンライン操作の両方をサポートしています。
- マッピングの精度向上のために、SL(4) manifold 最適化を利用しています。
Who it’s for
このプロジェクトは、ロボティクス、自律航法、および 03D シーン再構成の研究者や開発者向けに設計されています。
Highlights
- Real-time Performance: Capable of dense feed-forward scene reconstruction in real-time.
- Open-set Object Detection: Open-set 3D 物体検出をサポートし、テキストクエリによる 3D 空間内の任意の物体を検索可能。
- Hardware Integration: RealSense カメラを直接サポートし、ライブマッピングを可能にします。
- Flexible Visualization: Viser を使用して、段階的なマップ構築と点群可視化を行います。