BAAI-DCAI/SpatialBot

The official repo for "SpatialBot: Precise Spatial Understanding with Vision Language Models.

解决的问题

SpatialBot 旨在提升视觉语言模型(VLM)的精确空间理解能力。它弥补了 AI 模型在图像中感知深度和空间关系方面的差距,使其能够处理复杂的空间推理任务和机器人操作。

工作原理

SpatialBot 是基于 Bunny 架构的多图像 VLM。它可以处理多张输入图像,例如将 RGB 图像与深度图结合,以更好地理解场景的 3D 结构。它在 SpatialQA 数据集上进行训练,并可使用 LoRA(低秩适应)在特定数据集(如 SpatialQA-E)上进一步微调,用于机器人操作任务。

适用人群

本项目面向在机器人学、计算机视觉和具身 AI 领域工作的研究人员和开发者,特别是需要能够准确推理空间坐标和深度的模型的用户。

主要亮点

  • 多图像支持:可处理 0-8 张图像(RGB 和深度图),提供空间上下文。
  • RGB-D 集成:专门针对 RGB-深度输入优化,以提升空间精度。
  • 具身能力:可通过预测位移或关键点,作为视觉-语言-动作(VLA)模型用于抓取与放置的机器人操作。
  • 完整生态系统:包含 SpatialQA 训练集、SpatialBench 基准测试和 SpatialQA-E 具身数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目