Junchao-cs/SolarWM
Open data and scalable training for long-horizon video world models.
해결하는 문제
SolarWM은 대화형 비디오 세계 모델을 생성하기 위한 포괄적인 오픈소스 기반을 제공합니다. 이는 단 몇 초(약 5초)의 짧은 훈련 클립만을 사용하면서도 긴 시간 범위(수분에서 수시간에 걸친)의 카메라 제어 비디오 롤아웃을 생성할 수 있는 모델을 훈련하는 어려움을 해결하며, 동시에 다양한 기존 비디오 모델 백본과의 호환성을 유지합니다.
작동 방식
SolarWM은 통합된 데이터 인프라를 사용하여 수백만 개의 비디오 클립을 카메라 지오메트리와 캡션이 포함된 표준화된 형식으로 처리합니다. 그런 다음 3단계 훈련 레시피를 사용하여 양방향 비디오 모델을 인과적이고 자기회귀적인 모델로 변환합니다:
- 0.5단계 (양방향 적응): 비디오, 텍스트 및 카메라 조건부에 대한 기본 표현을 확립합니다.
- 1단계 (Teacher-Forced AnyFlow): 교사 강제(teacher forcing)를 AnyFlow 손실과 결합하여 노이즈 제거 및 유한 단계 흐름 맵을 학습하며, 별도의 ODE 초기화 필요성을 제거합니다.
- 2단계 (분포 매칭 증류): 고정된 교사 모델과 훈련 가능한 평가자(critic)를 사용하여 자체 롤아웃에 대해 인과적 학생 모델을 훈련하기 위해 자가 기울기 강제(SGF)를 사용합니다.
대상 사용자
Wan2.2, LTX-2.5, MiniMax-H3와 같은 다양한 비디오 백본을 기반으로 구축할 수 있는 확장 가능한 프레임워크를 원하는 비디오 생성, 세계 모델 및 대화형 AI 환경을 연구하는 연구원 및 개발자.
주요 특징
- 백본 무관: 다양한 아키텍처에 걸쳐 여러 5B~33B 모델 패밀리를 지원합니다.
- 장기 시간 범위 추론: 긴 시퀀스 파인튜닝 없이도 실시간 상호작용과 수분에서 수시간 지속되는 롤아웃을 가능하게 합니다.
- 오픈 데이터 파이프라인: 14개 데이터셋에서 가져온 143만 개의 정규화된 클립을 위한 재구성 가능한 인프라를 포함합니다.
- 간소화된 훈련: 복잡한 ODE 또는 일관성 증류 초기화를 피하는 간소화된 3단계 레시피입니다.
짧은 훈련 클립으로부터 장기 시간 범위의 카메라 제어 비디오 생성을 가능하게 하는, 대화형 비디오 세계 모델 구축을 위한 오픈소스 기반입니다.
확장 가능한 훈련과 장기 시간 범위 추론을 통해 대화형 비디오 세계 모델을 구축하기 위한 개방형 기반
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트