thu-ml/Causal-Forcing
[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++
해결하는 문제
인과 강제(Causal Forcing)는 고품질의 실시간 인터랙티브 동영상 생성을 위한 도전 과제를 해결합니다. 기존의 Self Forcing과 비교하여 동일한 학습 예산과 추론 효율을 유지하면서도, 자기회귀(AR) 확산 모델의 시각적 품질과 운동 역학을 향상시키는 것을 목표로 합니다.
작동 방식
이 프로젝트는 효율적인 동영상 생성기를 만드는 다단계 학습 파이프라인을 구현합니다:
- AR 확산 학습: 청크 단위 및 프레임 단위 모델의 기본 단계.
- 초기화: 인과 ODE(ODE 쌍 데이터 수집이 필요) 또는 인과 일관성 증류(Causal Forcing++에서 도입된 기법으로 진짜 데이터만 사용하고 ODE 데이터 수집이 필요 없음)를 통해 모델을 초기화.
- 비대칭 DMD: 최종 증류 단계로, 매우 적은 단계(예: 1, 2, 또는 4단계)에서 고품질 동영상을 생성할 수 있도록 합니다.
프레임 단위 모델은 첫 번째 잠재 프레임을 조건 이미지로 간주함으로써 텍스트-투-비디오(T2V)와 이미지-투-비디오(I2V) 생성을 자연스럽게 통합합니다.
대상 사용자
동영상 월드 모델, 실시간 인터랙티브 동영상 생성, 효율적인 확산 증류 기술에 종사하는 연구자 및 개발자에게 적합합니다.
주요 특징
- 고효율성: 1단계 및 2단계 프레임 단위 모델을 지원하여 극도로 낮은 지연 시간을 구현.
- 다양한 생성 가능성: 프레임 단위 설정에서 T2V와 I2V 모두를 네이티브로 지원.
- 장시간 동영상 지원: Rolling Forcing와 같은 확장 기능과 함께 사용하면 분 단위의 장시간 동영상 생성이 가능.
- 개선된 운동 역학: 시각적 품질과 운동 역학에서 Self Forcing을 능가합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트