malik-group/do-as-i-do
Official Codebase for "Do as I Do: Dexterous Manipulation Data from Everyday Human Videos"
해결하는 문제
Do as I Do는 인간의 물체 상호작용 영상에서 로봇이 학습할 수 있도록 도와줍니다. 이 프로젝트는 인간의 손-물체 상호작용을 영상 데모에서 실제 물리적 하드웨어에서 실행 가능한 궤적으로 변환하는 문제를 해결합니다.
작동 방식
이 프로젝트는 세 단계의 파이프라인을 사용합니다:
- 재구성: 인간의 손과 물체 영상을 3D 메시, 포인트맵, 6-DoF 자세 추적으로 변환합니다. SAM3, SAM3D, MoGe, HaWoR, TAPIR 등의 도구를 순차적으로 활용합니다.
- 리타겟팅: 재구성된 인간의 움직임을 로봇의 손과 팔에 매핑합니다. 볼록 분해, MJCF 시나리오 생성, MuJoCo Warp에서의 샘플링 기반 MPC를 사용하여 로봇이 실행 가능한 움직임임을 보장합니다.
- 배포: 리타겟팅된 움직임을 특정 하드웨어(이중-UR3e 암과 Sharpa Wave 핸드)용 관절 궤적으로 변환하고, 실제 로봇으로 스트리밍하여 재생합니다.
대상 사용자
로봇 공학 분야에서 연구 및 개발을 하는 연구자와 개발자, 특히 장치 내 학습(DoD) 및 인간에서 로봇으로의 운동 리타겟팅에 집중하는 분들을 대상으로 합니다.
주요 특징
- 엔드투엔드 파이프라인: 원시 영상 입력부터 실제 세계 로봇 실행까지 모든 과정을 커버합니다.
- 로봇 전용 배포: 이중-UR3e 암과 Sharpa Wave 핸드에서 실제로 테스트 및 배포되었습니다.
- 다수의 AI 도구 통합: 시각 기반 재구성과 물리 기반 리타겟팅을 통합합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트