BAAI-DCAI/SpatialBot

The official repo for "SpatialBot: Precise Spatial Understanding with Vision Language Models.

解決的問題

SpatialBot 是為提升視覺語言模型(VLM)的精確空間理解能力而設計。它彌補了 AI 模型在圖像中感知深度與空間關係方面的差距,使其能處理複雜的空間推理任務與機器人操作。

工作原理

SpatialBot 是基於 Bunny 架構的多圖像 VLM。它可處理多張輸入圖像,例如將 RGB 圖像與深度圖結合,以更佳理解場景的 3D 結構。它在 SpatialQA 資料集上訓練,並可使用 LoRA(低秩適應)在特定資料集(如 SpatialQA-E)上進一步微調,用於機器人操作任務。

適用對象

本專案針對在機器人學、電腦視覺與具身 AI 領域工作的研究人員與開發者,特別是需要能準確推理空間座標與深度的模型之使用者。

主要亮點

  • 多圖像支援:可處理 0-8 張圖像(RGB 與深度圖),提供空間上下文。
  • RGB-D 整合:專為 RGB-深度輸入優化,以提升空間精確度。
  • 具身能力:可透過預測位移或關鍵點,作為視覺-語言-動作(VLA)模型用於抓取與放置的機器人操作。
  • 完整生態系統:包含 SpatialQA 訓練集、SpatialBench 基準測試與 SpatialQA-E 具身資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案