dexmal/opendw

An Open-Source World Model for Action-Conditioned Embodied Intelligence.

해결하는 문제

DW05는 구현 지능(embodied intelligence)을 위해 설계된 멀티모달 세계 모델입니다. 로봇이 현재 관찰을 기반으로 특정 행동이 미래 결과로 이어지는 방식을 이해하도록 돕습니다. 미래 비디오 시퀀스를 예측하고, 행동을 생성하며, 상태 가치를 추정합니다.

작동 방식

DW05는 Wan 백본 위에 구축된 Mixture-of-Experts(MoT) 프레임워크를 사용합니다. 언어, 이미지/비디오, 로봇 유형, 상태, 행동 등의 입력을 처리합니다. 이 백본은 비디오 예측, 행동 생성, 상태 가치 추정을 위한 세 가지 전문 헤드로 공급됩니다.

대상

이 프로젝트는 로봇 학습, 구현 AI, 로봇 의사 결정을 위한 세계 모델을 연구하는 연구자와 개발자를 대상으로 합니다.

주요 특징

  • 통합 프레임워크: 비디오 예측, 행동 생성, 가치 추정을 단일 모델로 결합.
  • 멀티모달 입력: 언어, 시각적 관찰, 로봇 상태/고유 감각을 지원.
  • 사전 학습 가중치: Hugging Face를 통해 기본 및 미세 조정(SFT-RBT) 체크포인트 제공.
  • 행동 조건 롤아웃: 로봇 관찰과 행동을 기반으로 미래 비디오를 예측 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트