LeRobot 커뮤니티 데이터셋: 로봇공학의 ImageNet 구축

Hugging Face는 Vision-Language-Action (VLA) 모델에서 일반화라는 중요한 과제를 해결하기 위해 LeRobot을 통해 오픈소스 로봇 데이터셋의 커뮤니티 주도 생태계를 구축하고 있습니다. 모델 아키텍처에서 데이터 다양성으로 초점을 전환함으로써, LeRobot은 로봇 분야의 ImageNet에 해당하는 것을 만들고자 하며, 로봇이 새로운 환경, 객체 및 상황에서 작업을 수행할 수 있게 합니다.

일반화는 데이터 문제이다

로봇공학에서의 일반화—보지 못한 환경에서 새로운 객체와 함께 작업을 수행하는 능력—는 주로 모델의 특성이라기보다 데이터 현상입니다. VLA 모델이 세탁물을 접거나 큐브를 잡는 등의 작업을 수행할 수 있지만, 새로운 환경에 적응하는 능력은 다양한 학습 데이터의 가용성에 의해 제한됩니다.

범용 정책을 달성하기 위해서는 모델이 이질적인 데이터셋을 공동 학습해야 합니다. 이 과정은 모델이 더 넓은 패턴을 추상화하고 행동 방법뿐 아니라 장면과 목표 뒤에 숨은 근본적인 "왜"를 이해하도록 합니다. 현재 진행 상황은 대부분 로봇 데이터가 구조화된 학술 연구실에서 나오기 때문에 제한되며, 이는 ImageNet과 같은 인터넷 규모 데이터셋에서 발견되는 실제 세계 다양성이 부족합니다.

LeRobot 커뮤니티 접근 방식

LeRobot는 기록 파이프라인을 단순화하고 하드웨어 비용을 낮추며 Hugging Face Hub에 업로드를 간소화함으로써 로봇 데이터 수집을 민주화하고 있습니다. 이 노력은 고립된 연구실의 "데이터 섬"을 넘어 전 세계적인 공유 인프라를 만드는 것을 목표로 합니다.

현재 데이터셋 환경은 로봇 팔과 조작 작업이 주를 이루며, 특히 So100 및 Koch 로봇을 사용합니다. 그러나 이 이니셔티브는 다음과 같은 다른 분야로도 확장됩니다:

  • 자율 주행 차량
  • 보조 로봇
  • 모바일 내비게이션

주목할 만한 커뮤니티 기여로는 정밀한 가정용 서랍 조작 데이터셋, 스테레오 카메라로 촬영된 전체 체스 경기, 그리고 다채로운 동물 피규어와의 상호작용 데이터셋이 이미 포함됩니다.

로봇 기반 모델을 위한 데이터 피라미드

실제 세계 데이터는 추상적인 사전 지식과 구체적인 물리적 행동을 연결하는 필수적인 "연결 조직" 역할을 합니다. 학습을 최적화하기 위해 LeRobot는 데이터 양이 구현 구체성이 증가함에 따라 감소하는 데이터 피라미드 구조(Gr00t에서 차용)를 참조합니다:

  1. 기반: 대규모 웹 및 비디오 데이터.
  2. 시뮬레이션 다양성: 합성 데이터.
  3. 물리적 실행: 최상위에 실제 세계 로봇 상호작용.

실제 세계 상호작용의 양과 다양성을 늘리면 시뮬레이션-실제 간 격차가 해소되고 피라미드의 모든 층 사이의 연결이 구조적으로 강화되어 보다 견고하고 능력 있는 정책을 만들 수 있습니다.

커뮤니티 데이터 큐레이션의 과제

커뮤니티가 제공하는 데이터 양이 증가함에 따라, Hugging Face는 현재 큐레이션 파이프라인에서 네 가지 주요 과제를 확인했습니다:

  1. 불일치하는 작업 주석: 많은 데이터셋이 비어 있거나 지나치게 짧은(예: "Up") 혹은 모호한 작업 설명을 가지고 있어 인지 시스템이 상황을 이해하는 데 방해가 됩니다.
  2. 특징 매핑 불일치: 카메라 뷰 라벨링이 모호함(예: images.laptop을 사용하고 제3자 뷰인지 손목 뷰인지 명시하지 않음).
  3. 저품질 에피소드: 프레임이 매우 적거나 파일이 삭제된 후 재인덱싱되지 않아 순차적 일관성이 깨진 에피소드가 존재합니다.
  4. 차원 불일치: 동일한 로봇 하드웨어(예: So100)를 사용하더라도 행동 또는 상태 차원이 다르게 나타납니다.

고품질 로봇 데이터에 대한 모범 사례

커뮤니티 데이터셋의 활용도를 높이기 위해 LeRobot는 데이터 수집을 위한 표준화된 체크리스트를 제공합니다:

이미지 및 비디오 품질

  • 뷰: 가능하면 두 개의 카메라 뷰를 고해상도(최소 480x640 / 720p)로 사용합니다.
  • 안정성: 흔들림 없이 안정적인 비디오 촬영을 보장하고 중립적이며 안정적인 조명을 유지합니다.
  • 구도: 리더 팔이 프레임에 나타나지 않도록 하고, 팔로워 팔과 조작 대상만 보이게 합니다.
  • 배경: 정적이며 산만하지 않은 배경을 사용합니다.

메타데이터 및 명명 규칙

  • FPS: 비디오를 약 30fps로 녹화합니다.
  • 명명 규칙: <modality>.<location> 형식을 사용합니다(예: images.top, images.wrist.left). images.phone과 같은 장치 특정 이름은 피합니다.
  • 로봇 유형: 메타데이터에서 올바른 로봇 유형이 선택되었는지 확인하고, 일관성을 위해 LeRobot 구성 레지스트리를 참조합니다.

작업 주석

  • 명확성: task 필드를 사용해 목표를 명확히 기술합니다(예: "Pick the yellow lego block and put it in the box").
  • 길이: 설명은 간결하게, 보통 25~50자 사이로 유지하고 "task1"과 같은 일반 라벨은 피합니다.

Sources