LeRobot v0.6.0 릴리스 노트
LeRobot v0.6.0 릴리스 노트
세계 모델: 상상하는 정책
LeRobot v0.6.0은 훈련 중에 미래 프레임을 예측하면서 추가적인 추론 비용 없이 학습하는 세 가지 세계 모델 정책을 도입합니다.
VLA-JEPA
VLA-JEPA는 Qwen3-VL-2B를 기반으로 한 컴팩트한 VLA에게 잠재 공간에서 미래를 예측하도록 가르치면서 행동을 학습합니다: 훈련 중에 JEPA 세계 모델은 모델自身의 행동으로부터 upcoming frames을 예상합니다. 세계 모델은 추론 시 사라지며, 추가적인 추론 비용 없이 세계 모델 감독을 제공합니다. 허브에 세 가지 사용 가능한 체크포인트가 있으며, 파인튜닝을 위한 DROID-사전 훈련된 베이스도 포함됩니다:
lerobot-train \
--policy.path=lerobot/VLA-JEPA-Pretrain \
--dataset.repo_id=${HF_USER}/my_dataset \
--policy.repo_id=${HF_USER}/my_finetuned_policy
VLA-JEPA 문서와 논문을 참조하세요.
LingBot-VA
LingBot-VA는 미래 비디오와 행동을 함께 청크 단위로 예측하는 자기회귀 비디오‑액션 모델이며, 실제 관측치를 피드백하여 상상을 grounding시킵니다. 로봇이 상상한 내용을 저장할 수 있습니다 (--policy.save_predicted_video=true) 그리고 실제로 일어난 내용과 비교할 수 있습니다. 추론은 단일 24–32 GB GPU에서 실행됩니다. 문서와 논문을 참조하세요.
FastWAM
FastWAM은 약 5 B 비디오 생성 전문가와 컴팩트한 액션 전문가를 단일 네트워크에 결합하여 모델이 실제로 자신의 롤아웃을 꿈꾸도록 학습하게 합니다. 추론 시에는 꿈을 완전히 건너뛰고 바로 액션 청크를 디노이즈합니다. lerobot/fastwam_base에서 파인튜닝하고 문서에서 더 자세히 알아보세요.
VLAs: 모델 동물원이 계속 성장 중
출시는 GR00T N1.7부터 컴팩트한 EVO1까지 다섯 가지 새로운 비전‑언어‑액션 모델을 LeRobot 동물원에 추가합니다.
GR00T N1.7
우리는 NVIDIA GR00T 통합을 GR00T N1.7로 업그레이드했는데, 이는 NVIDIA의 크로스‑엠보디먼트 파운데이션 모델의 최신 오픈 세대입니다. N1.7은 이전 VLM을 Cosmos‑Reason2‑2B (Qwen3‑VL 기반)로 교체하고 플로우‑매칭 액션 헤드를 공급하며, 우리의 통합은 NVIDIA의 원래 Isaac‑GR00T 구현과 동등성 테스트를 통과했습니다: 동일한 입력, 동일한 출력. 플래시‑어텐션은 이제 선택 사항이므로 pip install 'lerobot[groot]'만으로 작동하며, NVIDIA의 공개된 체크포인트를 직접 로드할 수 있습니다.
GR00T N1.7은 LeRobot에서 N1.5를 대체합니다. N1.5가 필요하면
lerobot==0.5.1을 고정하세요.
MolmoAct2
MolmoAct2, Allen Institute for AI의 비전‑언어‑액션 모델은 이제 LeRobot에 포팅되어 전체 라이프사이클(풀 파인튜닝 또는 LoRA, 평가, 실제 로봇 배포)을 지원합니다. 캘리브레이션 수정이 내장된 готовые 체크포인트가 제공되어 SO‑100/101에서 제로샷으로 실행할 수 있습니다:
lerobot-rollout \
--policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
--task="pick up the red cube" --duration=30
추론은 bf16에서 약 12 GB에 맞으며, LoRA 파인튜싱은 단일 24 GB GPU에서도 가능합니다. MolmoAct2 문서를 참조하세요.
EO-1
EO‑1은 상류에서 interleaved vision‑text‑action 데이터로 사전 훈련된 VLA로, Qwen2.5‑VL‑3B 백본과 플로우‑매칭 액션 헤드를 갖추고 있으며, 논문의 저자 중 한 명이 기여했습니다. 표준 lerobot-train 워크플로우를 --policy.type=eo1과 함께 사용하여 훈련할 수 있습니다. 세부 사항은 문서와 논문에서 확인하세요.
Multitask DiT
Multitask Diffusion Transformer 정책은 LeRobot에 TRI Large Behavior Models 레시피를 가져옵니다: CLIP 비전 및 언어 임베딩에 조건을 붙인 약 450 M 파라미터의 디퓨전 트랜스포머로, 하나의 모델이 자연 언어로 선택된 많은 작업을 학습합니다. 디퓨전과 플로우‑매칭 목표를 모두 지원하며, 스스로 훈련하기에 충분히 작습니다. 문서를 참조하세요.
EVO1
VLAs는 반드시 커야 하는 것은 아닙니다. EVO1은 InternVL3‑1B 백본과 플로우‑매칭 액션 헤드를 갖춘 0.77 B 파라미터에 정책을 압축하여 modeste GPU에서도 실시간으로 파인튜닝 및 실행이 가능합니다. 두 단계 파인튜닝과 Real‑Time Chunking 지원을 기본으로 제공합니다. EVO1 문서와 논문을 참조하세요.
보상 모델: 로봇이 성공했는지 아는 방법
LeRobot v0.6.0은 비디오와 언어로부터 성공과 진행 상황을 점수 매기는 두 가지 새로운 사전 훈련된 모델을 갖춘 통합 보상 모델 API를 제공합니다.
Robometer
Robometer은 어떤 LeRobot 데이터셋이라도 가리켜 원시 비디오와 언어 지시로부터 작업 진행 상황과 성공을 점수 매기는 범용 사전 훈련된 보상 모델이며, 작업별 훈련이 필요 없습니다. Qwen3‑VL‑4B를 기반으로 하며, 1백만 개 이상의 로봇 트랙터리 데이터셋에 대한 트랙터리 비교를 통해 훈련되었습니다 (RSS 2026 논문).
TOPReward
TOPReward는 완전 제로샷입니다: 보상 가중치가 전혀 없습니다. 오프‑더‑셀프 VLM (Qwen3‑VL)을 감싸고 트랙터리 비디오와 작업 지시가 주어졌을 때 토큰 "True"의 로그‑확률을 읽습니다. 어떤 유능한 VLM도 보상 함수가 됩니다.
둘 다 라벨링 스크립트를 제공하여 데이터셋에 프레임별 진행 곡선을 기록하며, 이는 보상 인식 행동 클론(RA‑BC), 데이터셋 품질 검사, 진행 오버레이 비디오에 바로 사용할 수 있습니다. Robometer와 TOPReward 문서를 확인하세요.
데이터셋: 더 빠른 로딩, 더 풍부한 데이터
데이터셋 처리는 맞춤형 비디오 인코딩, 엔드‑투‑엔드 깊이, VLM을 통한 대규모 언어 주석, 그리고 최대 2× 빠른 데이터 로딩을 얻었습니다.
당신의 코덱, 당신의 규칙
녹화는 더 이상 하드코딩된 코덱에 얽매이지 않습니다. 새로운 --dataset.rgb_encoder.* 옵션은 코덱, 품질, 픽셀 포맷, GOP, 프리셋을 포함한 전체 인코딩 표면을 노출하며, vcodec=auto는 NVENC, VideoToolbox, VAAPI, QSV 같은 하드웨어 인코서를 probed한 후 기본 소프트웨어 AV1 인코더로 폴백합니다. 기존 데이터셋에 대해 하나의 명령으로 모든 것을 재인코딩할 수 있습니다:
lerobot-edit-dataset \
--repo_id ${HF_USER}/my_dataset \
--operation.type reencode_videos \
--operation.rgb_encoder.vcodec h264 \
--operation.rgb_encoder.crf 23
전체 세부 사항은 비디오 인코딩 문서에서 확인하세요.
깊이 지원, 엔드 투 엔드
Intel RealSense를 연결하고 use_depth: true를 설정하면 LeRobot은 밀리미터 단위로 캡처된 깊이 맵을 엔드 투 엔드로 기록하며, RGB 카메라와 함께 컴팩트한 12‑bit 깊이 비디오 스트림으로 압축하고 훈련 시 물리 단위로 다시 디코딩합니다. 깊이는 기록 중에 라이브로 렌더링되고 lerobot-dataset-viz에서도 작동하며, SO‑100/101, Koch, OpenArm, reBot, Unitree G1 등에서 지원됩니다.
대규모 언어 주석
데이터셋은 이제 에피소드당 하나의 작업 문자열에 머무르지 않습니다. LeRobot 데이터셋은 이제 타임스탬프가 있는 서브태스크, 계획, 메모리, 수정, 음성, 그리고 카메라당 VQA 쌍과 같은 풍부한 언어 주석을 네이티브로 저장하며, 새로운 lerobot-annotate CLI는 에피소드를 지켜보는 VLM을 사용하여 자동으로 채워줍니다:
lerobot-annotate \
--repo_id=${HF_USER}/my_dataset \
--new_repo_id=${HF_USER}/my_dataset_annotated \
--vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
--push_to_hub=true
YAML 레시피 레이어는 이러한 주석을 샘플 시점에 채팅‑스타일 훈련 메시지로 렌더링하여, 내일의 장거리 대화형 로봇 정책이 훈련할 데이터를 정확히 제공합니다. HF Jobs로 규모를 확장하고, 주석 파이프라인 문서를 읽어 더 자세히 알아보세요.
최대 2× 빠른 데이터 로딩
비디오 데이터셋에서의 훈련은 이제 기본적으로 최대 ~2× 빨라졌습니다: 멀티‑카메라 프레임이 병렬로 디코딩되고, 데이터로더 워커는 프로세스 간 메모리를 4× 줄이는 컴팩트한 uint8 프레임을 전송하며, 지속 워커는 에포크 간 디코더 캐시를 유지합니다. 큰 데이터셋의 하위 집합 로드 (episodes=[...])는 벤치마크에서 분에서 밀리초로 줄어들었습니다 (275 s에서 0.06 s). 샘플링도 이제 결정적이며 재개 가능하여 중단된 훈련이 샘플 정확하게 다시 시작할 수 있습니다.
벤치마크: 하나의 CLI로 모두 평가
여섯 개의 새로운 시뮬레이션 벤치마크가 평가 허브에 추가되었으며, 모두 단일 lerobot-eval 명령으로 접근 가능합니다.
- LIBERO-plus는 약 10,000개의 교란된 LIBERO 변형을 조명, 카메라 뷰포인트, 재작성된 지시 등 일곱 축에 걸쳐 VLAs를 스트레스 테스트하여 정책이 언제 깨지는지 알려줍니다.
- RoboTwin 2.0은 SAPIEN에서 cięż한 도메인 랜덤화와 함께 50개의 바이맨듈레이션 작업을 다루며, 허브에서 100k 이상의 준비된 훈련 트랙터리를 제공합니다.
- RoboCasa365은 모바일 매니퓰레이터에서 2,500개의 절차적으로 생성된 주방에서 365개의 주방 작업을 포괄하며, 우리의 라인업에서 가장 큰 작업 표면을 제공합니다.
- RoboCerebra는 언어‑그라운드된 중간 지시 아래 3~6개의 서브‑골드를 연결하는 에피소드로 장기 행동 행동을 평가하며, 추가로 6,660‑에피소드 데이터셋을 제공합니다.
- RoboMME는 메모리 시험입니다: 정책이 반복을 세고, 숨은 객체를 추적하며, 시연된 절차를 모방할 수 있나요? 4개의 메모리 스위트에 걸쳐 16개의 작업이 있습니다.
- VLABench는 물리 질문부터 끝까지 커피를 내리는 복합 작업까지 조작에서의 지식과 추론을 테스트합니다.
lerobot-eval \
--policy.path=lerobot/smolvla_robotwin \
--env.type=robotwin \
--env.task=beat_block_hammer \
--eval.n_episodes=100 --eval.batch_size=1
시뮬레이터 백엔드는 특정 시스템 의존성을 필요로 하며 각각의 설치 단계가 필요합니다; 각 문서 페이지에는 정확한 레시피가 있으며, 설치를 건너뛰고 싶다면 각 벤치마크에 준비된 Docker 이미지도 제공됩니다.
LIBERO, Meta‑World, NVIDIA IsaacLab‑Arena와 함께 이로써 하나의 지붕 아래 아홉 개의 벤치마크 패밀리가 형성되며, 새로운 Adding a New Benchmark 가이드는 자신만의 벤치마크를 플러그인하는 방법을 정확히 문서화합니다. 평가도 빨라졌습니다: 병렬 평가가 이제 비동기 벡터화된 환경으로 기본 설정되어 최대 2× 빨라졌다고 벤치마크되었습니다.
훈련 및 추론
훈련 및 배포는 DAgger‑스타일 데이터 수집, 멀티‑GPU 확장을 위한 FSDP, 그리고 HF Jobs를 통한 클라우드 훈련을 위한 전용 rollout CLI를 받습니다.
lerobot-rollout: 배포를 위한 자체 CLI
정책 배포는以前 lerobot-record 위에 해킹이 필요했습니다. 새로운 lerobot-rollout CLI는 배포를 자체 워크플로우로 만들고, 플러그 가능한 전략과 추론 백엔드(느린 호환 VLAs를 위한 Real‑Time Chunking 포함)를 제공합니다. base 전략은 단순히 정책을 실행합니다. sentry는 지속적으로 에피소드를 기록하고 허브에 업로드하면서 회전시킵니다. highlight는 키를 누를 때 마지막 N초를 저장하는 링 버퍼를 유지하여 흥미로운 순간을 놓치지 않습니다. episodic은 클래식 에피소드/리셋 기록 워크플로우를 반영합니다. 그리고 dagger는 배포를 데이터 수집으로 전환합니다.
DAgger 전략을 사용하면 정책이 실행되는 것을 보고, 잘못된 순간에 키(또는 USB 풋 페달)를 눌러 리더 암을 잡아 수정을 기록한 후 제어를 돌려줍니다. 구동되는 리더는 팔로워의 포즈로 이동되어 이 handover가 jerk‑free가 됩니다. 모든 수정 프레임은 intervention 플래그로 태그가 지정되며, 결과 데이터셋은 다음 파인튜닝을 위해 준비됩니다:
lerobot-rollout \
--strategy.type=dagger \
--policy.path=${HF_USER}/my_policy \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--teleop.type=so101_leader \
--teleop.port=/dev/ttyACM1 \
--dataset.repo_id=${HF_USER}/dagger_corrections \
--dataset.single_task="Grasp the block"
배포, 수정 수집, 파인튜닝, 반복: 로봇 학습 플라이휠은 이제 CLI 플래그입니다. 배포 문서를 참조하세요.
FSDP: GPU보다 큰 모델 훈련
로봇 파운데이션 모델은 단일 GPU를 초과하고 있습니다. LeRobot 훈련은 Accelerate를 통해 FSDP(완전 샤드 데이터 병렬)를 지원하여 매개변수, 그래디언트, 옵티마이저 상태가 GPU 간에 샤드되며, 체크포인트는 단일 파일 model.safetensors로 다시 모아져 다른 정책과 같이 로드됩니다. 심지어 다른 GPU 수에서 FSDP 실행을 재개할 수도 있습니다. 멀티‑GPU 훈련 문서를 참조하세요.
HF Jobs를 통한 클라우드 훈련
GPU가 없나요? 문제 없습니다. 정확히 동일한 lerobot-train 명령은 이제 한 플래그를 추가함으로써 클라우드에서 실행됩니다:
lerobot-train \
--dataset.repo_id=${HF_USER}/so101_test \
--policy.type=act \
--policy.repo_id=${HF_USER}/my_policy \
--job.target=a10g-small
LeRobot은 필요한 경우 로컬 데이터셋을 개인 허브 리포에 푸시하고, 작업을 제출하고, 로그를 터미널로 스트리밍하며, 마지막에 훈련된 정책을 허브에 푸시합니다. --job.target으로 T4부터 8× H200까지 선택할 수 있습니다 (컴퓨팅은 사용량에 따라 과금됩니다). 문서 확인
코드베이스: 더 가볍고 깨끗함
설치는 이제 더 가벼워졌으며, 의존성은 기능‑게이트 되었고, 사용성 개선에는 Foxglove 스트리밍, uv lock, Wayland 키보드 지원, 플러그인 기반 구성 요소가 포함됩니다.
pip install lerobot은 이제 진정으로 가벼워졌으며, 기본 의존성이 약 40 % 감소했습니다. 기능‑범위 별 엑스트라 ([training],[core_scripts],[evaluation], ...)가 나머지를 다루며, 누락된 의존성 오류는 정확히 어떤 엑스트라를 추가해야 하는지 알려줍니다. LeRobot 데이터셋만 사용하는 경우 하드웨어 관련 의존성을 더 이상 설치할 필요가 없습니다 :)지원되는 PyTorch는 2.7–2.11로 이동했으며, Linux
uv설치에 CUDA 12.8 휠이 기본으로 고정됩니다.--policy.dtype=bfloat16은 이제 Accelerate를 통해 실제 혼합 정밀도 훈련을 구동합니다.커밋된
uv.lock은 CI, Docker, 개발에 대한 권위 있는 의존성 사양이며, 문서에는 모든 단계에 대한uv설치 경로가 포함되어 있으며, 단일 플래그로 CUDA 휠을 선택하는 방법도 포함됩니다.--display_mode=foxglove는 텔레오퍼레이션, 녹화, 그리고 rollout을 Foxglove로 스트리밍합니다. 이는 로봇 세계에서 이미 널리 사용되는 시각화 도구이며, 원격 설정에서도 작동하며,lerobot-dataset-viz는 스크러블 가능한 데이터셋 재생을 제공합니다.pip‑설치 가능한
lerobot_env_*패키지는 이제 자신의 환경을 자체 등록합니다. 플러그인 시스템은 로봇, 카메라, 텔레오퍼레이터, 정책, 그리고 envs라는 다섯 가지 구성 요소 유형을 모두 다룹니다.녹화 중 키보드 컨트롤은 이제 Wayland, SSH over, 헤드리스 rig, 그리고 macOS에서 Accessibility 권한 없이도 작동합니다.
전체 목록과 브레이킹 변경에 대한 마이그레이션 포인트는 릴리스 노트를 확인하세요.
커뮤니티 및 생태계
LeLab 브라우저 UI, Isaac Teleop 통합, 하드웨어 가이드, 플러그인 정책 가이드와 같은 새로운 도구가 접근성을 확장합니다.
LeLab은 전체 LeRobot 워크플로우(캘리브레이트, 텔레오퍼레이트, 기록, 로컬 또는 HF Jobs에서 훈련, 배포)를 브라우저 UI에 넣어 CLI가 필요하지 않습니다. 현재 SO‑ARM101을 지원합니다. 사용해 보기!
Isaac Teleop은 NVIDIA의 Isaac Teleop 스택을 통해 VR 컨트롤러로 SO‑101을 텔레오퍼레이트하게 하며, CloudXR/OpenXR을 통해 NVIDIA 팀과의 협업 결과입니다. 문서를 참조하세요.
새로운 컴퓨트 하드웨어 가이드는 newcomer가 묻는 두 가지 질문에 답변합니다: 어떤 GPU가 필요하고, 훈련은 얼마나 걸릴까요? 정책 가족별 측정된 VRAM 범위와 RTX 4090부터 4× H100까지의 참조 훈련 시간을 제공합니다.
rewritten Adding a Policy 가이드는 자신만의 정책을 트리 내 또는 플러그인 패키지로서 PR 없이 배포하는 방법을 보여줍니다.
마무리 생각
헤드라인 기능 외에도, v0.6.0은 코드베이스 전반에 걸쳐 수백 개의 버그 수정, 문서 개선, 그리고 삶의 질 향상을 포함합니다: 더 스마트한 기본값부터 더 신뢰할 수 있는 CI까지.
우리는 커뮤니티의 모든 분께 큰 감사를 전하고 싶습니다. 이 릴리스에는 LeRobot을 모델과 벤치마크의 고향으로 선택한 학계, 산업, 취미 팀들의 작업이 포함됩니다. 모든 PR과 버그 보고서는 오픈소스 로봇공학을 앞으로 밀어냅니다.
더 많은 소식이 곧 나올 예정이니 기대해 주세요 🤗 시작은 여기에서! – LeRobot 팀 ❤️