PKU-EPIC/GraspVLA
[CoRL25] GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data
해결하는 문제
GraspVLA는 로봇의 그립 모델을 훈련할 때 발생하는 높은 비용과 데이터 부족 문제를 해결합니다. 고가의 실제 환경에서의 피니튜닝 없이도 다양한 물체를 실세계에서 오픈 밸류어리(Open-Vocabulary)로 그립할 수 있으며, 직접적인 시뮬레이션에서 실세계로의 전이를 달성합니다.
작동 방식
이 프로젝트는 세 가지 주요 구성 요소로 이루어져 있습니다:
- SynGrasp-1B: 240개의 객체 카테고리와 1만 개 이상의 객체를 포함하는 10억 프레임에 달하는 거대한 합성 데이터셋.
- GraspVLA 모델: 합성 데이터에서 사전 훈련된 비전-언어-액션(VLA) 모델입니다. 자기회귀적 인식(경계 상자와 목표 예측)과 플로우 매칭 기반의 액션 생성을 통합하는 통합 사고 과정(CoT) 프레임워크를 사용합니다.
- 하이브리드 훈련: 합성 액션 데이터와 인터넷 규모의 의미 데이터를 모두 사용하여 훈련되며, 오픈 밸류어리 명령을 이해하고 실행할 수 있도록 합니다.
대상 사용자
로봇 조작, 시뮬레이션에서 실세계로의 전이, 그리고 몸을 가진 지능을 위한 기초 모델에 종사하는 로봇 공학 연구자 및 개발자.
주요 특징
- 제로샷 일반화: 합성 데이터 사전 훈련 후 추가적인 피니튜닝 없이 실세계 물체를 그립할 수 있습니다.
- 10억 규모의 데이터: SynGrasp-1B 데이터셋을 활용하여 풍부한 다양성의 학습 예제를 제공합니다.
- 효율적인 추론: NVIDIA RTX L40s에서 약 9GB의 GPU 메모리로 200ms의 추론 지연을 달성합니다.
- 통합된 추론: CoT 프레임워크를 통해 인식과 액션을 하나의 추론 프로세스로 통합합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트