TX-Leo/HumanEgo
HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos
해결하는 문제
HumanEgo는 인간의 제1인칭 비디오를 매우 짧은 시간(수분) 동안 사용하여 복잡한 작업을 학습할 수 있게 해줍니다. 로봇 전용 훈련 데이터가 필요 없이 제1인칭 시점에서 촬영된 인간의 시연을 로봇 실행으로 전이하는 문제를 해결합니다.
작동 방식
이 시스템은 원시적인 제1인칭 비디오(예: Project Aria 안경에서 나온 것)를 로봇 실행 가능한 정책으로 변환하는 파이프라인을 사용합니다. 시각 기반 모델(SAM 2, Grounding DINO, CoTracker, Orient-Anything V2)을 활용해 데이터를 전처리합니다. 훈련 과정에서는 '상호작용 중심 토큰'(손과 물체의 6DoF 표현)과 몸체에 의존하지 않는 이미지(로봇 팔이 인페인팅된 이미지)를 입력으로 사용하는 플로우 매칭 정책을 사용하여 이중 팔 로봇의 미래 엔드 에펙터 궤적을 예측합니다.
대상 사용자
수동 로봇 프로그래밍이나 대규모 로봇 데이터셋 대신 인간의 시연을 사용하여 로봇을 훈련시키고 싶은 로보틱스 연구자 및 개발자.
주요 특징
- 제로샷 학습: 수분 간의 인간 제1인칭 비디오에서 학습 가능.
- 몸체 독립성: 인페인팅된 이미지와 상호작용 토큰을 사용해 인간 시연을 특정 로봇 하드웨어에서 분리.
- 포괄적인 도구 세트: Project Aria를 통한 데이터 수집, 전처리, 훈련, 실제 로봇 추론까지 포함하는 완전한 파이프라인.
- 오픈 데이터셋: 빵을 제공하거나 꽃에 물을 주는 등의 작업을 위한 공개된 데이터셋과 사전 학습된 체크포인트 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch