Robbyant/lingbot-va
[RSS 2026] Causal video-action world model for generalist robot control
해결하는 문제
LingBot-VA는 로봇 제어에서 동시에 세계 모델링과 행동 추론을 수행하는 문제를 해결합니다. 시각적 동역학 예측과 행동 생성을 통합함으로써 샘플 효율성 향상, 장기 목표 성공률 향상, 새로운 장면에 대한 일반화 능력 향상을 목표로 합니다.
작동 방식
이 프로젝트는 자기회귀(AR) 확산 프레임워크를 구현합니다. 시각적 동역학과 행동 추론을 하나의 시퀀스 내에서 교차하여 처리하는 이중 스트림 Mixture-of-Transformers (MoT) 아키텍처를 사용합니다. 고효율 실행을 위해 비동기 실행(Asynchronous Execution)과 KV 캐시를 활용합니다. 시스템은 원시 픽셀이 아닌 Wan2.2 VAE를 통해 처리된 동영상 잠재 표현을 기반으로 작동하며, FSDP를 사용한 분산 학습을 통해 사용자 정의 로봇 조작 데이터셋에 대한 사후 학습을 지원합니다.
대상 사용자
이 프레임워크는 로봇 제어, 시각적 세계 모델링, 몸을 가진 AI에 종사하는 로봇 연구자 및 개발자들을 위한 것으로, 사용자 정의 조작 데이터셋에서 모델을 피니튜닝하고자 하는 사람들을 대상으로 합니다.
주요 특징
- 통합 아키텍처: 시각적 동역학 예측과 행동 추론을 하나의 교차 시퀀스에 통합.
- 효율적인 실행: KV 캐시와 비동기 실행을 갖춘 이중 스트림 MoT 아키텍처 사용.
- 고성능: RoboTwin 2.0 및 LIBERO 벤치마크에서 최고 수준의 성공률 달성.
- 사용자 정의 가능: LeRobot 형식으로 데이터 변환 및 잠재 표현 추출을 포함한 사용자 정의 데이터셋에 대한 사후 학습을 위한 완전한 파이프라인 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트