BAAI-DCAI/SpatialBot
The official repo for "SpatialBot: Precise Spatial Understanding with Vision Language Models.
解決的問題
SpatialBot 是為提升視覺語言模型(VLM)的精確空間理解能力而設計。它彌補了 AI 模型在圖像中感知深度與空間關係方面的差距,使其能處理複雜的空間推理任務與機器人操作。
工作原理
SpatialBot 是基於 Bunny 架構的多圖像 VLM。它可處理多張輸入圖像,例如將 RGB 圖像與深度圖結合,以更佳理解場景的 3D 結構。它在 SpatialQA 資料集上訓練,並可使用 LoRA(低秩適應)在特定資料集(如 SpatialQA-E)上進一步微調,用於機器人操作任務。
適用對象
本專案針對在機器人學、電腦視覺與具身 AI 領域工作的研究人員與開發者,特別是需要能準確推理空間座標與深度的模型之使用者。
主要亮點
- 多圖像支援:可處理 0-8 張圖像(RGB 與深度圖),提供空間上下文。
- RGB-D 整合:專為 RGB-深度輸入優化,以提升空間精確度。
- 具身能力:可透過預測位移或關鍵點,作為視覺-語言-動作(VLA)模型用於抓取與放置的機器人操作。
- 完整生態系統:包含 SpatialQA 訓練集、SpatialBench 基準測試與 SpatialQA-E 具身資料集。
相關
- 專案
- 專案
- 專案
- 專案
- 專案