ginwind/VLA-JEPA
[ECCV 2026] VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
해결하는 문제
VLA-JEPA는 잠재 세계 모델을 통합함으로써 시각-언어-행동(VLA) 모델의 성능을 향상시킵니다. 이로 인해 환경의 동역학을 더 잘 이해하고 예측할 수 있게 되어, 다양한 벤치마크에서 복잡한 작업 수행 능력이 향상됩니다.
작동 방식
이 프로젝트는 시각-언어 모델(Qwen3-VL-2B)과 V-JEPA2 인코더를 결합하여, 시각 입력과 언어 지시를 처리하고 로봇 동작을 출력할 수 있는 모델을 구축합니다. 로봇 전용 데이터셋(LeRobot v2.1 형식)과 인간 영상 데이터셋 모두에서 학습이 가능하며, Chain-of-Thought(CoT) 프롬프팅을 활용한 잠재 동작 학습 방식을 사용합니다.
대상 사용자
현실 세계 및 시뮬레이션 환경에서 VLA 모델의 일반화 능력과 성능을 향상시키고자 하는 몸체 기반 AI(embodied AI) 연구자 및 개발자에게 적합합니다.
주요 특징
- Droid, LIBERO, BridgeV2, Fractal 등 다양한 데이터셋에서 학습 지원.
- 사용자 정의 로봇 데이터셋용 LeRobot v2.1 데이터 형식과 호환.
- LIBERO, LIBERO-Plus, SimplerEnv 벤치마크용 평가 스크립트 포함.
- Qwen3-VL과 V-JEPA2 통합으로 시각 및 잠재 세계 모델링 성능 향상.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트