thu-ml/Causal-Forcing
[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++
What it solves
Causal Forcing은 고품질 실시간 인터랙티브 비디오 생성 모델을 만드는 문제를 해결합니다. 특히 자기회귀(AR) 확산 모델에서 발생하는 노출 편향과 움직임 역학 저하 문제를 목표로 하여, 시각 품질이나 움직임 부드러움을 희생하지 않으면서 추론을 1‑4 단계로 빠르게 수행할 수 있게 합니다.
How it works
이 프로젝트는 복잡한 확산 모델을 빠른 자기회귀 생성기로 증류하기 위한 3단계 학습 파이프라인을 구현합니다:
- AR Diffusion Training: 기본 자기회귀 확산 모델을 구축합니다.
- Causal Initialization: Causal ODE(ODE‑페어 데이터가 필요) 또는 Causal Consistency Distillation(Causal Forcing++, 실제 데이터를 사용해 ODE 데이터 큐레이션 필요성을 없앰)를 사용해 이론적으로 올바른 초기화를 생성합니다.
- Asymmetric DMD: Distribution Matching Distillation을 적용해 생성에 필요한 단계 수를 추가로 감소시킵니다.
chunk-wise와 frame-wise 모델을 모두 지원하며, 후자는 첫 번째 잠재 프레임을 조건 이미지로 설정함으로써 Image‑to‑Video(I2V) 생성을 기본적으로 가능하게 합니다.
Who it’s for
비디오 생성에 종사하는 AI 연구자 및 개발자를 위한 것입니다. 특히 실시간 인터랙티브 비디오 도구나 Rolling Forcing과 같은 확장을 통한 장시간 비디오 생성 구현을 목표로 하는 분들에게 적합합니다.
Highlights
- Ultra-Low Latency: 1단계 및 2단계 frame‑wise 모델을 제공하여 매우 빠른 생성을 실현합니다.
- High Fidelity: 시각 품질과 움직임 역학 모두에서 기존 Self Forcing 등 방법을 능가합니다.
- Versatile Modalities: Text‑to‑Video(T2V)와 Image‑to‑Video(I2V)를 모두 지원합니다.
- Long Video Support: Rolling Forcing 등 기술과 호환되어 분 단위의 긴 비디오 생성이 가능합니다.