thu-ml/Causal-Forcing

[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

解决的问题

因果强制(Causal Forcing)解决了实现高质量、实时交互式视频生成的挑战。它特别旨在相比现有方法(如 Self Forcing)提升自回归(AR)扩散模型的视觉质量和运动动态,同时保持相同的训练预算和推理效率。

工作原理

该项目实现了一个多阶段训练流程,以创建高效的视频生成器:

  1. AR 扩散训练:适用于分块和逐帧模型的基础阶段。
  2. 初始化:使用 因果 ODE(需要 ODE 配对数据整理)或 因果一致性蒸馏(在 Causal Forcing++ 中引入,仅使用真实数据,无需 ODE 数据整理)对模型进行初始化。
  3. 非对称 DMD:最终蒸馏阶段,使模型能够在极少数步骤内(例如 1、2 或 4 步)生成高质量视频。

逐帧模型通过将第一个潜在帧作为条件图像,原生统一了文本到视频(T2V)和图像到视频(I2V)的生成。

适用人群

适用于从事视频世界模型、实时交互式视频生成以及高效扩散蒸馏技术的研究人员和开发者。

主要亮点

  • 高效率:支持 1 步和 2 步的逐帧模型,实现极低延迟。
  • 多功能生成:在逐帧设置中原生支持 T2V 和 I2V。
  • 长视频支持:兼容 Rolling Forcing 等扩展,可实现分钟级长视频生成。
  • 更优动态表现:在视觉质量和运动动态方面优于 Self Forcing。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目