ShuangLI59/unified_video_action

Official PyTorch Implementation of Unified Video Action Model (RSS 2025)

해결하는 문제

통합 동영상 행동(UVA) 모델은 미래의 동영상 프레임을 예측(시각적 전망이라 불림)하고 정밀한 동작을 수행할 수 있는 로봇 조작 정책을 훈련하는 문제를 해결합니다. 시각적 전망과 행동 예측을 함께 처리할 수 있는 통합 프레임워크를 구축하여, 로봇이 다양한 작업 간에 일반화하는 능력을 향상시키는 것을 목표로 합니다.

작동 방식

UVA는 성능을 최적화하기 위해 이단계 훈련 프로세스를 사용합니다:

  1. 동영상 생성 단계: 모델은 처음에 동영상 생성 작업에만 집중하여 세계의 변화를 시각적으로 표현하는 것을 학습합니다.
  2. 동영상과 행동의 동시 단계: 이후 모델은 미래의 동영상 프레임과 해당 로봇 행동을 동시에 예측하도록 피니튜닝됩니다.

사전 훈련된 VAE와 이미지 생성 모델(MAR)을 기반으로 합니다. 실제 환경 적용을 위해 ARX X5 로봇과 같은 다양한 하드웨어 설정을 지원하며, 훈련 데이터와 실시간 제어 주파수의 차이를 처리하기 위해 별도의 이력 주파수 기법을 포함합니다.

대상 사용자

모방 학습, 동영상 기반 행동 예측, 몸체화된 AI에 종사하는 로봇 연구자 및 개발자로, 로봇 제어에 시각적 전망을 통합하고자 하는 분들.

주요 특징

  • 이단계 훈련: 시각 학습과 행동 학습을 분리하여 안정성과 성능을 향상.
  • 다중 작업 지원: 시뮬레이션 작업(PushT, Libero10)과 실제 작업(컵 정리, 수건 접기, 마우스 정리)에서 성공적으로 검증됨.
  • 실제 환경 적용: ARX X5 로봇 및 UMI 하드웨어 통합을 위한 구체적인 지침 포함.
  • 확장 가능한 아키텍처: 새로운 작업과 사용자 정의 모델 추가를 위한 명확한 경로 제공.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트