open-gigaai/giga-brain-0

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

해결하는 문제

일반화 로봇을 훈련시키는 데는 일반적으로 막대한 양의 실제 세계 데이터가 필요하지만, 이를 수집하는 것은 비용이 많이 들고 느립니다. GigaBrain-0는 세계 모델을 사용해 대규모의 합성 데이터를 생성함으로써 실제 로봇 데이터에 대한 의존도를 줄이고, 다양한 작업, 물체 배치, 카메라 시점에 걸쳐 일반화 능력을 향상시킵니다.

작동 방식

GigaBrain-0는 시각-언어-행동(VLA) 기초 모델입니다. 실제 세계 로봇 데이터와 세계 모델이 생성한 대규모 합성 데이터를 결합합니다. 내구성과 추론 능력을 향상시키기 위해 RGBD(색상 및 깊이) 입력 모델링과 몸체 기반 Chain-of-Thought(CoT) 감독을 통합하여, 작업 수행 중 공간 기하학과 장기적 의존성을 추론할 수 있도록 합니다.

대상 사용자

체화된 AI 및 로봇 기술에 종사하는 연구자 및 개발자로, 실제 세계 데이터 수집에만 의존하지 않고 VLA 모델을 확장하고자 하는 사람들을 대상으로 합니다.

주요 특징

  • 세계 모델 데이터 엔진: 합성 데이터 생성을 통해 학습 확장과 태스크 간 일반화 향상.
  • 체화된 CoT: 공간 기하학과 물체 상태에 대한 Chain-of-Thought 추론 구현.
  • RGBD 지원: 깊이 정보 모델링을 통해 정책의 강건성 향상.
  • 고성능: GigaBrain-0.1 버전으로 RoboChallenge 리더보드에서 1위 달성.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트