NVlabs/GRAIL

A digital data-generation pipeline that synthesizes humanoid loco-manipulation data from 3D assets and video priors.

무엇을 해결하는가

GRAIL은 이동(locomotion)과 물체 상호작용(manipulation)을 모두 포함하는 복잡한 작업을 수행하는 휴머노이드 로봇을 위한 대규모 고품질 학습 데이터를 확보하는 데 따르는 어려움을 해결합니다. 값비싼 실제 데이터 수집에 의존하는 대신, 현실적인 학습 궤적을 합성하기 위한 완전한 디지털 파이프라인을 제공합니다.

작동 방식

파이프라인은 여러 단계를 통해 데이터를 생성합니다:

  1. Asset Generation: 3D 에셋을 생성합니다. 여기에는 절차적 지형(계단 등)과 AI 생성 물체가 포함됩니다.
  2. 2D-HOI Generation: Blender와 비디오 파운데이션 모델(Kling 또는 MiniMax-H3 등)을 사용하여 2D 인간-물체 상호작용(HOI) 비디오를 생성합니다.
  3. 4D-HOI Reconstruction: 이 비디오들을 미터법 4D 궤적으로 재구성합니다.
  4. Retargeting: 재구성된 인간의 움직임을 Unitree G1과 같은 특정 로봇에 리타겟팅합니다.
  5. Policy Training: 생성된 데이터는 물체 집기, 앉기, 고르지 않은 지형 이동과 같은 작업을 위한 범용 정책을 학습시키는 데 사용됩니다.

대상 사용자

휴머노이드 loco-manipulation 및 sim-to-real 전이를 연구하는 로봇 공학 연구자 및 엔지니어들을 위해 설계되었습니다.

주요 특징

  • End-to-End Digital Pipeline: 실제 인간의 시연 없이 3D 에셋과 비디오 사전 정보를 통해 데이터를 생성합니다.
  • Sim-to-Real Transfer: GRAIL로 생성된 데이터로만 학습된 정책이 실제 환경의 물체 집기 및 계단 오르기 작업으로 성공적으로 전이되었습니다.
  • Versatile Task Support: 테이블 위 및 바닥 물체 집기, 전신 조작(whole-body manipulation), 지형 이동(경사로, 연석, 계단)을 포함한 광범위한 동작을 지원합니다.
  • Integration with Video Models: 최첨단 비디오 파운데이션 모델을 활용하여 현실적인 상호작용 사전 정보를 합성합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트