2toinf/X-VLA

[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

해결하는 문제

X-VLA는 다양한 로봇 플랫폼(에보디먼트)에서 작동할 수 있는 일반화된 비전-언어-액션(VLA) 모델을 훈련하는 문제를 해결합니다. 다양한 로봇 데이터셋을 활용하여 다양한 하드웨어 간에 우수한 일반화 성능을 갖춘 모델을 구축함으로써, 로봇 조작 작업에서의 민첩성과 적응력을 향상시킵니다.

작동 방식

X-VLA는 소프트 프롬프트를 사용하는 트랜스포머 아키텍처를 사용합니다. 각 에보디먼트에 맞는 학습 가능한 임베딩(소프트 프롬프트)을 도입하여 통합된 트랜스포머 백본이 여러 도메인에 걸쳐 정책을 학습할 수 있도록 합니다. 일관성을 유지하기 위해 프로피오셉티브 입력과 액션 출력 모두에 통합된 엔드 에펙터 6D(EE6D) 제어 공간을 사용합니다.

대상 사용자

이 프로젝트는 물리적 로봇이나 LeRobot과 같은 시뮬레이션 플랫폼에 확장 가능한 크로스플랫폼 VLA 모델을 배포하고자 하는 로봇 연구자 및 개발자에게 적합합니다.

주요 특징

  • 에보디먼트 간 일반화: 6개의 시뮬레이션 플랫폼과 3대의 실제 로봇에서 최고 수준의 성능 달성.
  • 서버-클라이언트 아키텍처: 모델 환경과 로봇 고유의 종속성을 분리하여 패키지 충돌을 방지하고 분산 추론을 지원.
  • 통합 제어 공간: 다양한 로봇 암 간의 일관성을 보장하기 위해 표준화된 EE6D 제어 공간 사용.
  • 확장 가능한 학습: LoRA 미세조정과 모듈식 데이터셋 인터페이스를 지원하여 사용자 정의 로봇 시연 추가 가능.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트