yuantianyuan01/FastWAM
Official codebase for Fast-WAM: Do World Action Models Need Test-time Future Imagination?
해결하는 문제
FastWAM은 로보틱스에서 월드 액션 모델(WAMs)과 관련된 계산 오버헤드와 지연 문제를 해결합니다. 특히, '테스트 시 미래 상상'(행동 예측 전에 미래 영상 프레임을 예측하는 것)이 높은 성능을 위해 반드시 필요한지 탐구하며, 현재 관측에서 직접 행동을 예측할 수 있는 방법을 제공하여 훨씬 빠른 추론을 가능하게 합니다.
작동 방식
FastWAM은 노이즈 제거 코어(ActionDiT)와 VAE 인코딩 기반의 모델 아키텍처를 사용합니다. 주로 두 가지 운영 모드를 제공합니다:
- 첫 번째 프레임 모드 (Fast-WAM): 미래 영상 상상 단계를 건너뛰고 현재 관측에서 직접 행동을 예측하여 지연을 줄입니다.
- IDM 모드: 전통적인 접근 방식에 따라 먼저 미래 영상 프레임을 상상한 후, 그 상상 기반으로 행동을 예측합니다.
성능 최적화를 위해, 이 프로젝트는 컴파일된 노이즈 제거 코어, 배치 처리된 VAE 인코딩, 그리고 가벼운 CUDA Graph 백엔드를 구현하여 추론 시간과 학습 시간을 모두 단축합니다.
대상 사용자
이 프로젝트는 행동 예측, 월드 모델, 로봇 제어 정책의 실시간 성능 향상에 초점을 맞춘 체화 지능 분야의 로보틱스 연구자 및 개발자를 대상으로 설계되었습니다.
주요 특징
- 가속화된 추론: 이전 버전 대비 약 2배 빠른 엔드투엔드 추론을 달성했습니다.
- 이중 모드 기능: '옵셔널 IDM' 버전은 재학습 없이도 미래 상상(IDM)과 직접 행동 예측(첫 번째 프레임) 간 전환을 가능하게 합니다.
- 데이터셋 지원: LeRobot 2.1 및 3.0 데이터셋의 네이티브 지원으로 대규모 데이터에 대한 확장성이 향상되었습니다.
- 높은 성공률: 공간적, 목표적, 물체적, 장기 목표 태스크에서 LIBERO 벤치마크에서 우수한 성능을 보였습니다.
- 최적화된 파이프라인: 사전 계산된 T5 텍스트 임베딩과 컴파일된 학습 경로를 포함하여 처리량을 증가시킵니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch