shengshu-ai/minWM
A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models
해결하는 문제
minWM은 액션 조건부 실시간 동영상 월드 모델을 생성하기 위한 완전한 오픈소스 파이프라인을 제공합니다. 일반적인 양방향 텍스트-비디오(T2V) 기반 모델을 특정 액션이나 카메라 경로에 반응할 수 있는 실시간 인터랙티브 월드 모델로 변환하는 복잡한 과정을 단순화합니다.
작동 방식
이 프레임워크는 효율적이고 소수의 단계로 구성된 자기회귀(AR) 학생 모델로 기반 모델을 변환하는 다단계 증류 프로세스를 구현합니다. 파이프라인은 두 가지 주요 단계로 구성됩니다:
- 단계 1: 양방향 SFT - 초기 지도 미세조정.
- 단계 2: 증류 - 교사 강제 AR 확산, 인과 ODE/CD(인과 강제/인과 강제++) 및 비대칭 DMD와 자체 롤아웃을 포함하는 3단계 프로세스를 통해 4단계 실시간 추론을 달성합니다.
다양한 백본을 지원하며, 특히 Wan 2.1과 HunyuanVideo 1.5를 포함합니다. 또한 ProPE와 같은 방법을 사용하여 카메라 자세 등의 조건을 주입할 수 있습니다.
대상 사용자
기존 리포지토리를 처음부터 역설계하지 않고도 동영상 월드 모델을 구축하고 싶은 대학원생, 독립 연구자, 그리고 초보 연구실을 위한 것입니다.
주요 특징
- 풀스택 파이프라인: 데이터 구성 및 처리에서부터 학습 및 추론까지 모든 과정을 커버합니다.
- 다중 백본 지원: Wan 2.1과 HunyuanVideo 1.5 아키텍처 모두에서 작동합니다.
- 실시간 추론: 4단계 DMD 추론 프로세스로 모델을 증류하여 빠른 생성을 가능하게 합니다.
- LLM 기반 온보딩 지원: "Claude 스킬"을 포함하여 학습 실패 디버깅 및 새로운 모델 백본 통합을 도와줍니다.
- 카메라 제어: 포즈 문자열 또는 JSON 파일을 통해 정밀한 카메라 경로 제어를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트