thu-ml/Causal-Forcing

[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

What it solves

Causal Forcing は、高品質でリアルタイムなインタラクティブ動画生成モデルの構築という課題に取り組みます。特に自己回帰 (AR) 拡散モデルにおけるエクスポージャーバイアスとモーションダイナミクスの劣化という問題に焦点を当て、視覚品質や動きの滑らかさを犠牲にせずに推論を 1〜4 ステップに高速化します。

How it works

本プロジェクトは、複雑な拡散モデルを高速な自己回帰ジェネレータへと蒸留するための 3 段階トレーニングパイプラインを実装しています:

  1. AR Diffusion Training:ベースとなる自己回帰拡散モデルを構築します。
  2. Causal InitializationCausal ODE(ODE ペアデータのキュレーションが必要)または Causal Consistency Distillation(Causal Forcing++、真実データを使用して ODE データのキュレーション不要)を用いて理論的に正しい初期化を行います。
  3. Asymmetric DMD:Distribution Matching Distillation を適用し、生成に必要なステップ数をさらに削減します。

chunk-wiseframe-wise の両モデルをサポートし、後者は最初の潜在フレームを条件画像として設定することで、Image‑to‑Video (I2V) 生成をネイティブに可能にします。

Who it’s for

動画生成に取り組む AI 研究者・開発者向けです。特にリアルタイムインタラクティブ動画ツールや、Rolling Forcing などの拡張による長尺動画生成を実装したい方に適しています。

Highlights

  • Ultra-Low Latency:1 ステップおよび 2 ステップの frame‑wise モデルを提供し、極めて高速な生成を実現。
  • High Fidelity:視覚品質とモーションダイナミクスの両面で、従来の Self Forcing などを上回ります。
  • Versatile Modalities:Text‑to‑Video (T2V) と Image‑to‑Video (I2V) の両方をサポート。
  • Long Video Support:Rolling Forcing などの手法と互換性があり、分単位の長尺動画生成が可能です。