XiaomiRobotics/Xiaomi-Robotics-1

Code for Xiaomi-Robotics-1

해결하는 문제

Xiaomi-Robotics-1 (XR-1)은 로봇 공학의 "데이터 장벽", 즉 정책 모델의 확장을 제한하는 고품질의 수동 레이블링 로봇 데이터의 부족 문제를 해결합니다. 이를 통해 로봇은 보지 못한 환경에서 모바일 조작을 수행하고, 매우 적은 데모 데이터만으로도 새로운 복잡한 작업에 적응할 수 있습니다.

작동 원리

XR-1은 사전 학습된 Vision-Language Model (Qwen3-VL)과 Diffusion-Transformer (DiT)를 Mixture-of-Transformers (MoT) 아키텍처를 사용하여 결합한 Vision-Language-Action (VLA) 모델입니다. 다음의 2단계 학습 프로세스를 사용합니다:

  1. 사전 학습(Pre-training): 100,000시간 이상의 "embodiment-free" 궤적 데이터를 사용하여 모델을 학습시킵니다. 자동 레이블링 파이프라인이 이러한 궤적을 분할하고 상태 전환 설명을 생성하여, 특정 로봇 하드웨어 데이터 없이도 모델이 일반적인 동작 생성을 학습하도록 합니다.
  2. 사후 학습(Post-training): 교차 엔보디먼트(cross-embodiment) 데이터(실제 로봇 및 오픈 소스 데이터)를 사용하여 모델의 정렬을 수행함으로써 일반적인 능력을 특정 로봇 하드웨어에 매핑하고 모델을 자연어 지침에 맞게 정렬합니다.

대상

이 프로젝트는 모바일 조작을 위한 파운데이션 모델을 구축하는 로봇 공학 연구자 및 개발자와, 다양한 환경 및 작업에 일반화할 수 있는 범용 로봇 정책을 배포하고자 하는 사람들을 위해 설계되었습니다.

주요 특징

  • 대규모 스케일: 1,700개 이상의 시나리오에 걸친 100K시간 이상의 실제 조작 궤적으로 사전 학습됨.
  • SOTA 성능: RoboCasa365 및 RoboDojo 리더보드에서 1위 기록.
  • 데이터 효율성: 작업당 단 몇 시간의 데모만으로 새로운 복잡한 작업을 학습할 수 있음.
  • 실시간 최적화: 비동기 실행을 사용하여 추론 지연 시간을 줄이고 소비자용 GPU에 최적화됨.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트