Robbyant/lingbot-vla

A Pragmatic VLA Foundation Model

해결하는 문제

LingBot-VLA는 로봇 제어에 대한 실용적이고 고성능인 접근 방식을 제공하도록 설계된 Vision-Language-Action (VLA) 파운데이션 모델입니다. 이 모델은 다양한 로봇 구성에 대해 일반화할 수 있고 시뮬레이션과 실제 환경 모두에서 높은 성공률로 작업을 수행할 수 있는 모델을 만드는 문제를 해결합니다.

작동 원리

이 모델은 9가지의 서로 다른 양팔 로봇 구성에서 수집된 20,000시간의 실제 데이터라는 방대한 데이터셋으로 사전 학습되었습니다. 표준 버전과 성능 향상을 위해 깊이(depth) 정보를 통합한 깊이 증류(depth-distilled) 버전의 두 가지 버전이 제공됩니다. 코드베이스는 학습 효율성을 위해 최적화되어 기존 VLA 코드베이스보다 1.5배에서 2.8배 빠른 속도를 제공하며 GPU 메모리 사용량을 줄였습니다.

대상 사용자

이 프로젝트는 물리적 로봇 또는 시뮬레이션(RoboTwin 2.0 등)에 VLA 모델을 배포하고자 하는 로봇 연구자 및 개발자, 그리고 커스텀 로봇 데이터를 위한 효율적인 사후 학습(post-training) 파이프라인을 찾는 분들을 대상으로 합니다.

주요 특징

  • 대규모 사전 학습: 9가지 로봇 구성에 걸친 20,000시간의 데이터로 학습됨.
  • 높은 효율성: 상당한 학습 속도 향상 및 GPU 메모리 소비 감소.
  • 깊이 인식 옵션: 깊이 정보가 없는 모델과 깊이 증류 모델 체크포인트를 모두 제공.
  • 강력한 벤치마크: GM-100 및 RoboTwin 2.0 벤치마크에서 최첨단(SOTA) 결과 달성.
  • LeRobot 통합: 데이터 처리 및 배포를 위해 LeRobot v3.0과 완벽하게 호환됨.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트