shengshu-ai/minWM

A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models

해결하는 문제

minWM은 액션 조건부 실시간 동영상 월드 모델을 생성하기 위한 완전한 오픈소스 파이프라인을 제공합니다. 일반적인 양방향 텍스트-비디오(T2V) 기반 모델을 특정 액션이나 카메라 경로에 반응할 수 있는 실시간 인터랙티브 월드 모델로 변환하는 복잡한 과정을 단순화합니다.

작동 방식

이 프레임워크는 효율적이고 소수의 단계로 구성된 자기회귀(AR) 학생 모델로 기반 모델을 변환하는 다단계 증류 프로세스를 구현합니다. 파이프라인은 두 가지 주요 단계로 구성됩니다:

  1. 단계 1: 양방향 SFT - 초기 지도 미세조정.
  2. 단계 2: 증류 - 교사 강제 AR 확산, 인과 ODE/CD(인과 강제/인과 강제++) 및 비대칭 DMD와 자체 롤아웃을 포함하는 3단계 프로세스를 통해 4단계 실시간 추론을 달성합니다.

다양한 백본을 지원하며, 특히 Wan 2.1HunyuanVideo 1.5를 포함합니다. 또한 ProPE와 같은 방법을 사용하여 카메라 자세 등의 조건을 주입할 수 있습니다.

대상 사용자

기존 리포지토리를 처음부터 역설계하지 않고도 동영상 월드 모델을 구축하고 싶은 대학원생, 독립 연구자, 그리고 초보 연구실을 위한 것입니다.

주요 특징

  • 풀스택 파이프라인: 데이터 구성 및 처리에서부터 학습 및 추론까지 모든 과정을 커버합니다.
  • 다중 백본 지원: Wan 2.1과 HunyuanVideo 1.5 아키텍처 모두에서 작동합니다.
  • 실시간 추론: 4단계 DMD 추론 프로세스로 모델을 증류하여 빠른 생성을 가능하게 합니다.
  • LLM 기반 온보딩 지원: "Claude 스킬"을 포함하여 학습 실패 디버깅 및 새로운 모델 백본 통합을 도와줍니다.
  • 카메라 제어: 포즈 문자열 또는 JSON 파일을 통해 정밀한 카메라 경로 제어를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트