BAAI-DCAI/SpatialBot
The official repo for "SpatialBot: Precise Spatial Understanding with Vision Language Models.
해결하는 문제
SpatialBot은 시각 언어 모델(VLM)의 정밀한 공간 이해 능력을 향상시키기 위해 설계되었습니다. AI 모델이 이미지 내의 깊이와 공간 관계를 어떻게 인식하는지에 대한 격차를 메우며, 복잡한 공간 추론 작업과 로봇 조작을 처리할 수 있게 합니다.
작동 방식
SpatialBot은 Bunny 아키텍처를 기반으로 한 다중 이미지 VLM입니다. RGB 이미지와 깊이 맵을 결합하여 장면의 3차원 구조를 더 잘 이해할 수 있도록 여러 입력 이미지를 처리할 수 있습니다. SpatialQA 데이터셋으로 훈련되었으며, 로봇 조작 작업을 위해 SpatialQA-E와 같은 특정 데이터셋에서 LoRA(저랭크 적응)를 사용해 추가 미세 조정이 가능합니다.
대상 사용자
이 프로젝트는 로봇공학, 컴퓨터 비전, 몸체 인공지능 분야에서 일하는 연구자 및 개발자를 대상으로 하며, 공간 좌표와 깊이에 대해 정확히 추론할 수 있는 모델이 필요한 사람들에게 적합합니다.
주요 특징
- 다중 이미지 지원: RGB 및 깊이 맵을 포함한 0~8장의 이미지를 처리하여 공간적 맥락을 제공합니다.
- RGB-D 통합: RGB-깊이 입력에 특별히 최적화되어 공간 정밀도를 향상시킵니다.
- 몸체 기능: delta 위치 또는 키포인트를 예측함으로써 피크앤플레이스 로봇 조작용 시각-언어-행동(VLA) 모델로 사용할 수 있습니다.
- 포괄적인 생태계: SpatialQA 학습 세트, SpatialBench 벤치마크, SpatialQA-E 몸체 데이터셋을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트