dexmal/dexbotic

Dexbotic: Open-Source Vision-Language-Action Toolbox

해결하는 문제

Dexbotic은 신체적 지능을 위한 시각-언어-행동(VLA) 모델 개발의 복잡성을 해결합니다. 사전 훈련, 파인튜닝, 추론, 평가를 포함한 VLA 개발 전 과정을 단일 도구로 간소화하여, 다양한 로봇 정책을 다룰 때 분산된 설정이 필요 없도록 합니다.

작동 방식

PyTorch 기반으로, 계층적 구성, 팩토리 등록, 엔트리 디스패치를 기반으로 한 모듈식 아키텍처를 사용합니다. 이는 연구자가 모델을 교체하거나, 작업 구성 설정을 수정하거나, 실험 스크립트를 통해 새로운 기능을 추가할 수 있도록 하며, 핵심 로직을 다시 작성하지 않아도 됩니다. 다양한 로봇을 위한 통합된 훈련 데이터 형식을 지원하며, 주류 알고리즘을 위한 최적화된 사전 훈련 기반 모델을 제공합니다. 로컬 소비자 GPU와 클라우드 플랫폼 모두에서 작동하도록 설계되었으며, Blackwell GPU와 같은 고성능 하드웨어에도 특별한 지원을 제공합니다.

대상 사용자

로봇 조작 및 탐색을 위한 VLA 모델을 개발하거나 평가하는 신체적 지능 분야의 연구자 및 개발자에게 적합합니다.

주요 특징

  • 광범위한 모델 지원: π0, CogACT, OFT, MemVLA, DM0 등 주류 VLA 정책을 통합합니다.
  • 로봇 호환성: UR5, Franka, ALOHA 등 로봇을 위한 통합된 데이터 형식과 배포 스크립트를 제공합니다.
  • 유연한 훈련: 로컬 및 클라우드 훈련을 지원하며, FSDP2를 통한 분산 훈련과 GRPO를 통한 강화 학습도 지원합니다.
  • 최적화된 추론: 통합된 v1 추론 API와 Triton 기반 실시간 백엔드를 통해 성능을 크게 향상시킵니다.
  • 포괄적인 벤치마킹: Libero, CALVIN, SimplerEnv, ManiSkill2, RoboTwin2.0 등의 환경을 위한 즉시 사용 가능한 평가 파이프라인을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch