BAAI-DCAI/SpatialBot
The official repo for "SpatialBot: Precise Spatial Understanding with Vision Language Models.
何を解決するか
SpatialBotは、視覚言語モデル(VLM)の正確な空間理解を向上させるために設計されています。AIモデルが画像内の奥行きや空間関係をどのように認識するかというギャップを埋め、複雑な空間推論タスクおよびロボット操作を処理できるようにします。
動作方法
SpatialBotはBunnyアーキテクチャに基づくマルチイメージVLMです。複数の入力画像(たとえばRGB画像と深度マップの組み合わせ)を処理でき、シーンの3D構造をよりよく理解できます。SpatialQAデータセットで訓練されており、ロボット操作タスク用にSpatialQA-Eなどの特定データセットでLoRA(低ランク適応)による微調整も可能です。
対象ユーザー
このプロジェクトは、ロボット工学、コンピュータビジョン、エンベデッドAIに取り組む研究者や開発者を対象としています。特に、空間座標や奥行きについて正確に推論できるモデルが必要な方々に適しています。
特徴
- マルチイメージ対応: RGBおよび深度マップを含む0〜8枚の画像を処理可能で、空間的文脈を提供します。
- RGB-D統合: RGB-深度入力に特に最適化されており、空間的精度を向上させます。
- エンベデッド機能: delta位置やキーポイントを予測することで、ピックアンドプレースロボット操作用の視覚言語行動(VLA)モデルとして利用可能です。
- 包括的なエコシステム: SpatialQAトレーニングセット、SpatialBenchベンチマーク、SpatialQA-Eエンベデッドデータセットを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト