Xiaomi-Robotics-1: 100K 시간 데이터로 비전‑언어‑행동 모델 확장
Xiaomi-Robotics-1: 100K 시간 데이터로 비전‑언어‑행동 모델 확장
Xiaomi-Robotics-1은 고품질 로봇 데이터의 부족을 극복하기 위해 두 단계 학습 과정을 사용하는 로봇 기반 모델입니다: 대규모 embodiment‑free 사전 학습 후 embodiment 및 instruction 정렬. 이 접근 방식은 데이터 양과 모델 크기에 따라 예측 가능하게 확장될 수 있게 하여 실제 모바일 매니퓰레이션 작업 및 시뮬레이션 벤치마크에서 성공률을 향상시킵니다.
로봇 데이터 병목 현상 타파
로봇공학은 고품질 실제 로봇 데이터를 수집하기가 어렵고 비용이 많이 들어 정책 모델을 확장하는 데 한계가 있었습니다. Xiaomi-Robotics-1은 "embodiment‑free"(UMI) 사전 학습을 활용함으로써 이를 해결합니다.
UMI 데이터로 사전 학습
사전 학습 단계에서 Xiaomi는 100,000시간에 달하는 embodiment‑free 궤적을 1,700개가 넘는 시나리오(가정, 상업, 산업, 야외 공간 포함)에서 사용합니다. 이 방대한 데이터를 처리하기 위해 비전‑언어 모델(VLM)로 구동되는 자동 라벨링 파이프라인을 개발했으며, 궤적을 고정 길이 구간으로 나누고 장면 상태 전환에 대한 언어 설명을 부착합니다.
사후 학습 및 정렬
사전 학습 후, 모델은 일반적인 행동 생성 능력을 특정 로봇 하드웨어와 인간 지시에 맞추는 사후 학습 단계에 들어갑니다. 이 정렬은 두 축을 따라 진행됩니다:
- Embodiment Alignment: 일반 행동 생성 능력을 실제 물리 로봇에 매핑합니다. 여기에는 실제 가정에서 수집한 7,200시간 이상의 고품질 교차‑embodiment 실제 로봇 데이터(예: 소파 정리, 신발 캐비닛 정리)가 포함됩니다.
- Instruction Alignment: 모델이 상태 전환 설명을 기반으로 행동을 생성하는 방식에서 자연어 지시를 직접 실행하도록 전환합니다.
로봇공학의 스케일링 법칙
Xiaomi-Robotics-1은 로봇 기반 모델이 명확한 스케일링 특성을 보인다는 것을 입증합니다. 사전 학습 데이터 양과 모델 크기가 증가함에 따라 검증 행동 오류가 감소하고, 보지 못한 환경에서의 실제 로봇 성공률이 꾸준하고 예측 가능하게 상승합니다.
출처 자료에 따르면, 스케일링 이득은 포화 조짐을 보이지 않으며, 더 강력한 사전 학습 모델이 사후 학습 후 실제 로봇 성능을 일관되게 향상시킵니다.
성능 및 적용 사례
Xiaomi-Robotics-1은 최소한의 실제 로봇 시연으로 새로운 복잡한 작업에 효율적으로 적응할 수 있는 기반 모델입니다.
효율적인 작업 적응
작업당 평균 10시간 미만의 시연으로 모델은 전화 포장, 프린터 리필, 세탁물 적재와 같은 작업에서 전체 성공률 **75%**를 달성합니다. 이는 $ π 0.5$ 베이스라인(40%)보다 거의 두 배에 달합니다. 예산을 작업당 40시간 미만으로 늘리면 전체 성공률이 **85%**로 상승합니다.
| Task | <10 h/task (XR-1) | <10 h/task ($\pi 0.5$) | <40 h/task (XR-1) | <40 h/task ($\pi 0.5$) |
|---|---|---|---|---|
| Phone Packing | 70% | 30% | 80% | 40% |
| Printer Refilling | 70% | 20% | 60% | 20% |
| Laundry Loading | 80% | 40% | 80% | 50% |
| Box Packing | 80% | 70% | 100% | 100% |
| Overall | 75% | 40% | 85% | 53% |
시뮬레이션 벤치마크
Xiaomi-Robotics-1은 일반화에 중점을 둔 네 가지 주요 시뮬레이션 벤치마크에서 최첨단(SOTA) 결과를 달성했습니다:
| Benchmark | XR-1 Success Rate | 2nd Best | Relative Gain |
|---|---|---|---|
| RoboCasa | 74.5% | 72.6% | +2.6% |
| RoboCasa365 | 57.4% | 46.6% | +23.2% |
| VLABench | 59.1% | 53.2% | +11.1% |
| RoboDojo | 13.93% | 8.80% | +58.3% |
커뮤니티 인사이트 및 기술 토론
Hacker News의 기술 관찰자들은 영상 시연에 나타난 작업들의 복잡성을 논의하며, 모델이 여러 전통적으로 어려운 로봇 문제를 동시에 해결한다고 지적했습니다:
"두 손 조정 - 모바일 바디 - 변형 가능한 물체 - 얇은 어포던스(특히 가방 지퍼) - 다중 물체 단일 그립... 각각이 인식 혹은 매니퓰레이션 문제로 따로 다뤄졌던 요소들을 한 번에 처리한다."
다른 사용자들은 가정용 로봇의 미래에 대해 낙관적인 의견을 제시했으며, 일부는 모델 및 가중치의 가용성에 의문을 제기했습니다. 한 사용자는 XiaomiRobotics-0의 자산은 제공되었지만, Xiaomi-Robotics-1 모델과 데이터셋은 아직 GitHub이나 Hugging Face 저장소에 존재하지 않는다고 언급했습니다.
결론
Xiaomi-Robotics-1은 대규모 embodiment‑free 사전 학습이 로봇 기반 모델을 확장하는 실현 가능한 경로임을 증명합니다. 데이터 병목을 해소하고 일반적인 능력을 물리 로봇에 정렬함으로써, Xiaomi는 보지 못한 환경에 잘 일반화되고 새로운 작업에 높은 데이터 효율성으로 적응할 수 있는 모델을 만들었습니다.
요약: Xiaomi-Robotics-1은 100,000시간의 궤적 데이터를 활용한 embodiment‑free 사전 학습을 통해 로봇공학의 데이터 병목을 해소하고, 모바일 매니퓰레이션 작업에서 최첨단 성능을 달성한 로봇 기반 모델입니다.
제목: Xiaomi-Robotics-1: 100K 시간 데이터로 비전‑언어‑행동 모델 확장