Robbyant/lingbot-vla-v2

From Foundation to Application

해결하는 문제

LingBot-VLA 2.0는 대규모 사전 훈련과 신뢰할 수 있는 실제 세계 로봇 응용 간의 격차를 메우기 위해 설계된 시각-언어-행동(VLA) 기반 모델입니다. 다양한 로봇 유형(신체 구조)과 작업에 걸쳐 일반화하면서도 시뮬레이션 및 실제 환경에서 높은 성능을 유지하는 문제를 해결합니다.

작동 방식

이 모델은 50,000시간의 로봇 궤적과 10,000시간의 에고센트릭 인간 영상이 포함된 총 60,000시간의 대규모 사전 훈련 코퍼스를 사용합니다. 다음과 같은 주요 기술적 혁신을 채택합니다:

  • 통합된 행동 표현: 암, 엔드 에펙터, 그립퍼, 다지 손, 허리, 머리, 모바일 베이스를 포함하는 55차원의 표준 상태/행동 벡터로 다양한 로봇 구성 요소를 매핑합니다.
  • MoE 행동 전문가: 행동 전문가 내부에 스파스한 Mixture-of-Experts(MoE) 계층을 사용하여 보편적인 사전 지식과 전문화된 신체 구조/작업 패턴이 공존할 수 있도록 합니다.
  • 이중 쿼리 증류: LingBot-Depth와 DINO-Video로부터 인지 쿼리를 증류하여 현재 장면의 기하학적 구조와 미래 장면의 진화(예측 동역학 모델링)를 모두 포착합니다.

대상 사용자

이 프로젝트는 다양한 하드웨어 구성에서 작동하고 복잡한 조작 작업을 수행할 수 있는 일반화된 로봇 정책을 배포하고자 하는 로봇 연구자 및 개발자에게 적합합니다.

주요 특징

  • 광범위한 일반화: 20가지의 다른 로봇 구성에서 구성된 대규모 데이터셋으로 훈련되었습니다.
  • 확장된 행동 공간: 표준 이중 팔 조작을 넘어서는 다양한 로봇 구성 요소를 지원합니다.
  • 높은 성능: GM-100 이중 팔 조작 및 장기 시간 스케일 모바일 조작 벤치마크에서 이전 버전 및 경쟁 제품을 능가합니다.
  • 실제 세계 적용 가능: 시뮬레이션(RoboTwin) 및 실제 로봇용 배포 스크립트를 포함하며, RTX 4090D에서 추론 시간은 약 130ms입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트