LeRobotDataset 비디오 인코딩 포맷이 로봇 데이터셋 크기를 줄이고 학습 속도를 높입니다

TL;DR

Hugging Face는 LeRobotDataset 포맷을 도입했으며, 로봇 시각 데이터를 압축 비디오 스트림으로 저장하여 데이터셋 크기를 원본의 평균 14 % 수준으로 줄이면서 로딩 속도와 학습 성능을 그대로 유지합니다.

로봇 데이터셋이란 무엇이며 비디오가 도움이 되는 이유

엔드‑투‑엔드 학습을 위한 로봇 데이터셋은 두 가지 모달리티로 구성됩니다: (1) 시각 스트림(카메라 이미지)과 (2) 고유감각 혹은 목표‑위치 벡터(상태/행동). 과거에는 시각 프레임을 개별 PNG 파일로 저장했는데, 연속 프레임이 큰 영역에서 유사성을 공유하기 때문에 매우 중복됩니다. 비디오 코덱은 spatial compression(JPEG과 유사)과 temporal compression(프레임 간 차이만 저장)을 활용해 1:20 이상의 압축 비율을 달성합니다. 시각 모달리티를 비디오로 인코딩하면 동일한 정보를 원본 크기의 일부만 차지하게 저장하면서도 학습 시 빠르게 디코딩할 수 있습니다.

LeRobotDataset의 기여

  • Simple – 에피소드당 하나의 비디오 파일과 가벼운 메타데이터 파일.
  • Lightweight – 평균 저장 용량이 원본 이미지 크기의 14 %이며, 일부 데이터셋은 <1 %까지 축소됩니다.
  • Fast to load – 단일 프레임 디코딩은 PNG 로드와 비슷하고, 연속 프레임 여러 개를 디코딩하는 데는 동일한 수의 PNG를 로드하는 시간의 25 %–50 %만 소요됩니다.
  • Easy to share – Hugging Face Hub와의 네이티브 통합.
  • Easy to visualize – 인터랙티브 Spaces를 통해 사용자가 비디오와 관련된 행동을 탐색할 수 있습니다.

비디오 인코딩 작동 원리 (코덱 기본)

비디오 인코딩은 두 가지 메커니즘을 통해 크기를 줄입니다:

  1. Spatial compression – 이미지 내부 패턴(예: 넓은 하늘 영역)을 활용해 각 프레임을 압축합니다.
  2. Temporal compression – 프레임 간 차이만 저장(P‑frames/B‑frames)하고, 주기적인 keyframes(I‑frames)를 기준으로 합니다.

인코딩된 비트스트림은 MP4와 같은 컨테이너에 포장됩니다. 저자들은 다양한 코덱 선택, 픽셀 포맷, GOP 크기, constant‑rate‑factor(CRF) 설정을 평가하기 위해 벤치마크를 구축했습니다( GitHub repo 참고).

평가 기준

  • Size – 작은 파일은 저장 및 다운로드 비용을 줄입니다.
  • Decoding time – 빠른 프레임 추출은 학습을 가속화합니다.
  • Quality – 정책 성능 저하를 방지하려면 높은 시각적 충실도가 필요합니다.
  • Compatibility – 비디오는 브라우저와 일반 미디어 플레이어에서 재생 가능해야 하며, 픽셀 포맷 yuv420p가 이 요구를 만족합니다.

벤치마크 변수 및 데이터셋

데이터셋 해상도 장면 유형
lerobot/pusht_image 96 × 96 시뮬레이션된 기하학적 형태
aliberts/aloha_mobile_shrimp_image 480 × 640 실제 실내, 움직이는 카메라
aliberts/paris_street 720 × 1280 실제 실외, 움직이는 카메라
aliberts/kitchen 1080 × 1920 실제 실내, 고정 카메라

탐색한 인코딩 파라미터에는 세 가지 코덱(libx264, libx265, libsvtav1), 두 가지 픽셀 포맷(yuv444p, yuv420p), 140 범위의 GOP 크기, 0(무손실)50(고손실) 범위의 CRF 값이 포함됩니다.

프로덕션을 위한 선택 설정 (v1.6)

  • Codec: libsvtav1 (AV1 구현)
  • Pixel format: yuv420p
  • GOP size: 2 (키프레임이 매 두 프레임마다)
  • CRF: 30 (품질과 압축의 균형)

이 설정은 이전 libx264‑기반 v1.5에 비해 시각 품질을 개선하면서 호환성을 유지합니다.

달성된 크기 감소

70개 이상의 공개 로봇 데이터셋에서 평균 압축 비율은 원본 크기의 **14 %**에 불과합니다. 소스 이미지가 압축되지 않은 경우 일부 데이터셋은 원본의 **0.2 %**까지 축소되었습니다. 예시 감소량:

  • lerobot/nyu_rot_dataset: 5.3 MB → 318 KB (5.8 %)
  • lerobot/utokyo_xarm_pick_and_place: 1.3 GB → 54.6 MB (4.1 %)
  • lerobot/berkeley_gnm_recon*: 18.7 GB → 29.3 MB (0.2 %)

전체 표는 원본 블로그 게시물에 제공됩니다.

로딩 시간 성능

비디오를 사용할 경우 해상도에 따른 로딩 시간 스케일이 훨씬 개선됩니다. advantageous 시나리오(여러 연속 프레임)에서는 디코딩 시간이 PNG 기준의 **4 %–48 %**에 불과하며, 이는 해상도와 코덱에 따라 달라집니다. 소스의 그래프는 2‑프레임 및 6‑프레임 배치에서 명확한 이점을 보여줍니다.

품질 지표

저자들은 디코딩된 프레임에 대해 세 가지 표준 이미지‑품질 지표를 측정했습니다:

  • MSE (낮을수록 좋음)
  • PSNR (높을수록 좋음)
  • SSIM (높을수록 좋음)

네 개의 벤치마크 데이터셋에서 libsvtav1 + yuv420p + crf=30 조합은 PSNR와 SSIM에서 일관되게 최고 성능을 보이며 MSE는 낮게 유지했습니다. 예를 들어 aliberts/kitchen 데이터셋에서 AV1은 PSNR = 39.20 dB와 **SSIM = 96.84 %**를 달성해 H.264와 H.265를 모두 앞섰습니다.

정책 학습에 미치는 영향

두 개의 대표적인 정책—pusht 데이터셋의 Diffusion과 aloha 데이터셋의 ACT—에 대한 학습 곡선은 비디오‑인코딩 포맷을 사용해도 성능 저하가 없음을 보여줍니다. 곡선은 원시 PNG 데이터를 사용할 때와 겹쳐져 압축이 학습에 해를 끼치지 않음을 확인합니다.

향후 방향

현재 벤치마크에서는 여러 인코딩 옵션(-preset, -tune, 두 단계 인코딩)과 대체 디코더(torchcodec, decord 등)를 제외했습니다. 이를 탐색하면 크기‑품질‑속도 트레이드‑오프를 더욱 개선할 수 있습니다. 또한 RGB 프레임과 함께 깊이 맵을 인코딩하는 문제도 남아 있습니다.

왜 중요한가

시각 데이터를 효율적인 비디오 스트림으로 압축함으로써 Hugging Face는 대규모 로봇 학습 데이터셋을 저장·공유·학습하기에 실용적으로 만들었습니다. 이 접근법은 이미 방대한 인터넷 규모 데이터를 활용하고 있는 다른 AI 분야와 로봇 분야 사이의 격차를 좁혀, 엔드‑투‑엔드 로봇 정책 학습 연구를 가속화할 가능성을 열어줍니다.


SUMMARY: Hugging Face는 LeRobotDataset 비디오 인코딩 포맷을 출시하여 로봇 시각 데이터를 원본 크기의 약 14 %로 축소하면서 로딩 속도와 학습 성능을 유지합니다.

TITLE: LeRobotDataset 비디오 인코딩 포맷이 로봇 데이터셋 크기를 줄이고 학습 속도를 높입니다

Sources