2toinf/X-VLA
[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
해결하는 문제
X-VLA는 다양한 로봇 플랫폼(에보디먼트)에서 작동할 수 있는 일반화된 비전-언어-액션(VLA) 모델을 훈련하는 문제를 해결합니다. 다양한 로봇 데이터셋을 활용하여 다양한 하드웨어 간에 우수한 일반화 성능을 갖춘 모델을 구축함으로써, 로봇 조작 작업에서의 민첩성과 적응력을 향상시킵니다.
작동 방식
X-VLA는 소프트 프롬프트를 사용하는 트랜스포머 아키텍처를 사용합니다. 각 에보디먼트에 맞는 학습 가능한 임베딩(소프트 프롬프트)을 도입하여 통합된 트랜스포머 백본이 여러 도메인에 걸쳐 정책을 학습할 수 있도록 합니다. 일관성을 유지하기 위해 프로피오셉티브 입력과 액션 출력 모두에 통합된 엔드 에펙터 6D(EE6D) 제어 공간을 사용합니다.
대상 사용자
이 프로젝트는 물리적 로봇이나 LeRobot과 같은 시뮬레이션 플랫폼에 확장 가능한 크로스플랫폼 VLA 모델을 배포하고자 하는 로봇 연구자 및 개발자에게 적합합니다.
주요 특징
- 에보디먼트 간 일반화: 6개의 시뮬레이션 플랫폼과 3대의 실제 로봇에서 최고 수준의 성능 달성.
- 서버-클라이언트 아키텍처: 모델 환경과 로봇 고유의 종속성을 분리하여 패키지 충돌을 방지하고 분산 추론을 지원.
- 통합 제어 공간: 다양한 로봇 암 간의 일관성을 보장하기 위해 표준화된 EE6D 제어 공간 사용.
- 확장 가능한 학습: LoRA 미세조정과 모듈식 데이터셋 인터페이스를 지원하여 사용자 정의 로봇 시연 추가 가능.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트