starVLA/starVLA
StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
해결하는 문제
StarVLA는 일반화 로봇을 위한 시각-언어-행동(VLA) 모델 개발을 간소화하기 위해 설계된 모듈식 연구 플랫폼입니다. 모델 백본, 액션 헤드, 학습 레시피와 같은 구성 요소를 전체 파이프라인을 다시 작성하지 않고도 교체하고 통합할 수 있는 '레고처럼' 구성 가능한 코드베이스를 제공함으로써 이러한 시스템 구축의 복잡성을 해결합니다.
작동 방식
이 플랫폼은 학습 인프라스트럭처와 특정 모델 아키텍처를 분리한 비결합형, 조합 가능한 스택을 사용합니다. 사용자는 Qwen 시리즈나 Florence-2와 같은 기초 모델 백본과, 자동 회귀 이산 토큰, 병렬 연속 디코딩, 또는 플로우 매칭 전문가와 같은 교환 가능한 액션 헤드를 자유롭게 조합할 수 있습니다. 시스템은 표준화된 모델 전방 인터페이스와 모델 독립적인 데이터로더를 유지하여, 선택한 프레임워크 변형에 관계없이 데이터 흐름이 일관되게 유지됩니다.
대상 사용자
일반화 로봇 정책을 개발하고 다양한 VLA 아키텍처, 학습 패러다임, 벤치마크를 실험하는 로봇 연구자 및 개발자를 주요 대상으로 합니다.
주요 특징
- 모듈식 아키텍처: 하위 모듈의 독립적 디버깅과 '스모크 테스트'를 가능하게 하여 빠른 프로토타이핑을 지원합니다.
- 다양한 액션 헤드: StarVLA-FAST, StarVLA-OFT, StarVLA-PI, StarVLA-GR00T의 구현을 포함합니다.
- 광범위한 벤치마크 지원: SimplerEnv, LIBERO, Robocasa, RoboTwin 2.0, RoboDojo 등 수많은 벤치마크와 통합되어 있습니다.
- 유연한 학습: SFT(지도 미세조정), 다중 모달 공동 학습, RLinf를 통한 RL 포스트 트레이닝을 지원합니다.
- 하드웨어 호환성: Ascend NPU 및 소규모 VLM용 단일 A100 GPU에서 학습을 지원합니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트