OpenWAM-Official/OpenWAM

Official repository for "OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining".

해결하는 문제

OpenWAM은 세계 지식(미래 상태/비디오 예측)과 행동 학습(로봇 행동 예측)을 결합하는 World-Action Models (WAMs) 개발을 위한 모듈식 연구 스택을 제공합니다. 밀접하게 결합된 설계 선택에서 벗어나, 연구자들이 모델 아키텍처, 표현 방식, 학습 전략의 다양한 조합을 체계적으로 실험하여 로봇이 세계 지식을 습득하고 다양한 도메인으로 확장되는 능력을 향상시킬 수 있도록 합니다.

작동 방식

OpenWAM은 세 가지 주요 구성 요소로 구성됩니다:

  • OpenWAM-Infra: 사용자가 다양한 비디오 백본(예: Wan, Cosmos), VLM 백본(예: Qwen3-VL), 그리고 WAM 아키텍처(단일, 이중, 삼중 시스템)를 조합하고 비교할 수 있는 모듈식 인프라스트럭처입니다.
  • OpenWAM-Study: 세계 지식과 행동 학습의 결합 원리를 도출하기 위해 사용되는 통제된 연구 세트입니다.
  • OpenWAM-α: 5,180만 프레임 이상의 에고센트릭 인간 및 로봇 데이터로 사전 훈련된 대규모 기초 모델입니다.

아키텍처는 단순한 공유 시스템에서부터 별도의 행동 및 비디오 DiT를 갖춘 복잡한 이중 시스템, 고수준 이해를 위한 동결된 VLM을 포함하는 삼중 시스템까지 다양합니다.

대상 사용자

세계 모델과 일반화된 로봇 정책을 개발하는 AI 연구자 및 로봇 공학자에게 적합합니다. 특히 시각적 결과와 로봇 행동을 모두 예측할 수 있는 모델의 사전 훈련 및 미세 조정을 고려하는 분들에게 적합합니다.

주요 특징

  • 모듈식 설계: 교체 가능한 비디오 백본, 시각 인코더, VLM 백본을 지원합니다.
  • 광범위한 벤치마크: RoboTwin, LIBERO, RoboCasa365, VLABench 등에서 평가를 통합적으로 지원합니다.
  • uma 기초 모델: OpenWAM-α를 포함하며, 6,400시간 분량의 데이터로 사전 훈련된 모델입니다.
  • 유연한 아키텍처: 단일, 이중, 삼중 시스템과 같은 다양한 시스템 구성으로 행동과 세계 지식의 통합 방식을 테스트할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트