apple-aiml-research/ml-egodex

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

해결하는 문제

EgoDex는 복잡한 기민한 손동작을 학습할 수 있도록 대규모이고 고품질의 데이터셋과 벤치마크를 제공합니다. 에고세트리크 영상과 정밀한 3D 포즈 애노테이션을 함께 제공함으로써, 로봇이나 AI가 복잡한 테이블 위 작업을 수행하도록 훈련할 수 있는 데이터 부족 문제를 해결합니다.

작동 방식

Apple Vision Pro와 ARKit를 사용하여 수집된 데이터셋은 194개의 다양한 작업에서 총 829시간의 1080p 영상으로 구성되어 있습니다. 각 영상은 다음을 포함하는 HDF5 파일과 짝을 이룹니다:

  • 3D 포즈 애노테이션: 머리, 상체, 68개의 손 관절에 대한 SE(3) 변환.
  • 신뢰도 점수: 관절 탐지의 신뢰성을 나타내는 값.
  • 언어 메타데이터: GPT-4와 같은 LLM 및 VLM이 생성한 작업 설명.

리포지토리는 데이터를 PyTorch로 로드하고, 3D 골격 데이터를 시각화하며, 궤적 예측 품질을 평가하기 위한 거리 메트릭을 계산하는 Python 스크립트를 포함합니다.

대상 사용자

  • 로봇 공학 연구자: 기민한 조작을 위한 로봇 기초 모델이나 시각-언어-행동(VLA) 모델을 개발하는 사람.
  • 컴퓨터 비전 엔지니어: 에고세트리크 영상에서 3D 인간 포즈 추정을 연구하는 사람.
  • AI 개발자: 로봇 배포를 위해 인간의 손 움직임을 모방하는 모델을 훈련하는 사람.

주요 특징

  • 대규모 규모: 3D 애노테이션이 포함된 800시간 이상의 에고세트리크 영상.
  • 다양한 작업: 194개의 다양한 활성 테이블 위 조작 작업을 커버.
  • 고정밀도: visionOS의 ARKit를 사용하여 손과 신체의 세부적인 골격 추적을 수행.
  • 통합 벤치마크: 예측된 기민한 궤적의 품질을 평가할 수 있는 도구를 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트