thu-ml/Causal-Forcing

[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

What it solves

Causal Forcing 解决了创建高质量、实时交互式视频生成模型的挑战。它专门针对自回归 (AR) 扩散模型中的曝光偏差和运动动态退化问题,使推理速度提升至 1‑4 步,同时不牺牲视觉质量或运动流畅度。

How it works

该项目实现了三阶段训练流水线,将复杂的扩散模型蒸馏为快速的自回归生成器:

  1. AR Diffusion Training:建立基础的自回归扩散模型。
  2. Causal Initialization:使用 Causal ODE(需要精心挑选的 ODE 配对数据)或 Causal Consistency Distillation(Causal Forcing++,利用真实数据消除 ODE 数据整理需求)来创建理论上正确的初始化。
  3. Asymmetric DMD:应用 Distribution Matching Distillation 进一步降低生成所需的步数。

它支持 chunk-wiseframe-wise 两种模型,后者通过将第一个潜在帧设为条件图像,原生支持 Image‑to‑Video (I2V) 生成。

Who it’s for

此框架适用于从事视频生成的 AI 研究者和开发者,特别是希望实现实时交互式视频工具或长篇视频生成(如 Rolling Forcing 扩展)的用户。

Highlights

  • Ultra-Low Latency:提供 1 步和 2 步的 frame‑wise 模型,实现极快的生成速度。
  • High Fidelity:在视觉质量和运动动态上均优于之前的方法,如 Self Forcing。
  • Versatile Modalities:支持 Text‑to‑Video (T2V) 与 Image‑to‑Video (I2V)。
  • Long Video Support:兼容 Rolling Forcing 等技术,可生成分钟级别的视频。