PKU-EPIC/GraspVLA

[CoRL25] GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

해결하는 문제

GraspVLA는 로봇의 그립 모델을 훈련할 때 발생하는 높은 비용과 데이터 부족 문제를 해결합니다. 고가의 실제 환경에서의 피니튜닝 없이도 다양한 물체를 실세계에서 오픈 밸류어리(Open-Vocabulary)로 그립할 수 있으며, 직접적인 시뮬레이션에서 실세계로의 전이를 달성합니다.

작동 방식

이 프로젝트는 세 가지 주요 구성 요소로 이루어져 있습니다:

  1. SynGrasp-1B: 240개의 객체 카테고리와 1만 개 이상의 객체를 포함하는 10억 프레임에 달하는 거대한 합성 데이터셋.
  2. GraspVLA 모델: 합성 데이터에서 사전 훈련된 비전-언어-액션(VLA) 모델입니다. 자기회귀적 인식(경계 상자와 목표 예측)과 플로우 매칭 기반의 액션 생성을 통합하는 통합 사고 과정(CoT) 프레임워크를 사용합니다.
  3. 하이브리드 훈련: 합성 액션 데이터와 인터넷 규모의 의미 데이터를 모두 사용하여 훈련되며, 오픈 밸류어리 명령을 이해하고 실행할 수 있도록 합니다.

대상 사용자

로봇 조작, 시뮬레이션에서 실세계로의 전이, 그리고 몸을 가진 지능을 위한 기초 모델에 종사하는 로봇 공학 연구자 및 개발자.

주요 특징

  • 제로샷 일반화: 합성 데이터 사전 훈련 후 추가적인 피니튜닝 없이 실세계 물체를 그립할 수 있습니다.
  • 10억 규모의 데이터: SynGrasp-1B 데이터셋을 활용하여 풍부한 다양성의 학습 예제를 제공합니다.
  • 효율적인 추론: NVIDIA RTX L40s에서 약 9GB의 GPU 메모리로 200ms의 추론 지연을 달성합니다.
  • 통합된 추론: CoT 프레임워크를 통해 인식과 액션을 하나의 추론 프로세스로 통합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트