OpenGalaxea/GalaxeaVLA

Galaxea's open-source VLA repository

해결하는 문제

GalaxeaVLA는 시각 인식, 자연어 지시, 정밀한 모터 동작을 결합하여 복잡한 조작 작업을 수행할 수 있는 일반 목적의 로봇 제어 시스템을 제공합니다. 이 모델은 고수준의 추론(무엇을 해야 하는지 이해하는 것)과 저수준의 실행(로봇 팔을 어떻게 움직일지) 사이의 격차를 단일 모델 내에서 해결합니다.

작동 방식

핵심은 G0.5라는 자기회귀형 시각-언어-행동(VLA) 모델입니다. 기존 시스템이 별도의 인코더로 VLM을 사용하는 것과 달리, G0.5는 하나의 트랜스포머 디코더를 사용하여 추론 토큰과 행동 토큰을 하나의 연속된 스트림으로 생성합니다.

주요 기술적 구성 요소:

  • 통합 스트림: 다중 뷰 RGB 이미지, 로봇 상태, 텍스트 지시를 처리하여 먼저 몸체화된 추론(예: 하위 작업 및 객체 기반)을 포함하는 시퀀스를 출력한 후, 구조화된 행동 토큰을 출력합니다.
  • 크로스-바디 액션코덱: 다양한 로봇 동작을 공유되는 27차원 행동 공간으로 매핑하는 학습된 토크나이저로, 모델이 다양한 로봇 하드웨어 간에 일반화할 수 있도록 합니다.
  • 내장형 체인 오브 쓰로우트: 추론이 토큰 시퀀스에 직접 통합되어, 모델이 실제 이동 명령을 내리기 전에 작업에 대해 "생각"할 수 있습니다(예: 객체의 경계 상자 식별).
  • 시각 메모리: 인과적 공간-시간 어텐션을 사용하여 수 초에 걸친 시각 기록을 포함하여 안정성과 맥락 인식을 향상시킵니다.

대상 사용자

이 프로젝트는 R1 Lite, R1 Pro, SO-100/101, Franka와 같은 실제 로봇에 모델을 배포하거나 LIBERO 및 RoboTwin과 같은 시뮬레이터에서 테스트하는 데 초점을 맞춘, 체화된 AI에 종사하는 로봇 연구자 및 개발자를 대상으로 합니다.

주요 특징

  • 단일 스트림 아키텍처: 추론과 행동을 하나의 다음 토큰 예측 목적에 통합합니다.
  • 광범위한 하드웨어 지원: 여러 실제 로봇 구현체에 대한 배포 엔트리포인트를 포함합니다.
  • 높은 성능: DROID(82.5%) 및 LIBERO(98.9%)와 같은 벤치마크에서 뛰어난 제로샷 성공률을 보입니다.
  • 오픈월드 데이터셋: RLDS 및 LeRobot 형식으로 500시간 이상의 실제 세계 모바일 조작 데이터를 제공합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트