NVIDIA/Isaac-GR00T
NVIDIA Isaac GR00T N1.7 - A Foundation Model for Generalist Robots.
해결하는 문제
NVIDIA Isaac GR00T N1.7은 범용 휴머노이드 로봇 기술을 제공하도록 설계된 오픈 시각-언어-행동(VLA) 모델입니다. 이 모델은 언어 및 이미지와 같은 멀티모달 입력을 처리하고 이를 연속적인 로봇 동작으로 변환함으로써 로봇이 다양한 환경에서 조작 작업을 수행할 수 있도록 합니다.
작동 원리
이 모델은 백본으로 시각-언어 파운데이션 모델(Cosmos-Reason2-2B / Qwen3-VL)과 연속적인 동작의 노이즈를 제거하는 확산 트랜스포머(DiT) 헤드를 결합하여 사용합니다. N1.7의 핵심 혁신은 상대적 말단 장치(EEF) 액션 공간의 사용으로, 이는 동작을 절대적 목표가 아닌 현재 포즈로부터의 델타(차이)로 표현합니다. 이를 통해 20,000시간의 인간 비디오 데이터(EgoScale)에서 학습된 조작 사전 지식을 다양한 로봇 형태에 걸쳐 로봇 제어로 전송할 수 있습니다.
대상
이 프로젝트는 휴머노이드 또는 세미 휴머노이드 로봇에 범용 조작 기술을 배포하고자 하는 로봇 연구자 및 개발자, 그리고 커스텀 로봇 데이터로 VLA 모델을 미세 조정하고자 하는 분들을 위한 것입니다.
주요 특징
- 교차 신체 일반화(Cross-Embodiment Generalization): 공유된 상대적 액션 공간을 사용하여 다양한 로봇 유형에서 작동합니다.
- 인간-로봇 전이: 대규모 인간 비디오 데이터셋으로 사전 학습되어 언어 따르기 및 일반화 능력을 향상시켰습니다.
- 유연한 배포: 제로샷 추론, 커스텀 데이터를 통한 미세 조정 및 TensorRT를 통한 가속화를 지원합니다.
- 폭넓은 통합: Hugging Face LeRobot과 호환되며 RoboCasa 및 SimplerEnv와 같은 다양한 벤치마크를 지원합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트