thu-ml/Causal-Forcing
[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++
何を解決するか
因果強制(Causal Forcing)は、高品質でリアルタイムのインタラクティブな動画生成を実現する課題に取り組んでいます。従来の手法(例:Self Forcing)と比較して、同じ訓練予算と推論効率を維持しつつ、自己回帰(AR)拡散モデルにおける視覚的品質と運動ダイナミクスを向上させることを目的としています。
仕組み
このプロジェクトは、効率的な動画生成器を作成するためのマルチステージ訓練パイプラインを実装しています:
- AR拡散訓練:チャンク単位およびフレーム単位のモデルのベースステージ。
- 初期化:因果ODE(ODEペアデータの収集が必要)または因果一貫性蒸留(Causal Forcing++で導入された手法。真のデータのみを用い、ODEデータの収集を不要に)のいずれかでモデルを初期化。
- 非対称DMD:最終的な蒸留ステージで、非常に少ないステップ数(例:1、2、または4ステップ)で高品質な動画を生成可能にします。
フレーム単位のモデルは、最初の潜在フレームを条件画像として扱うことで、テキストから動画(T2V)と画像から動画(I2V)の生成をネイティブに統合します。
対象ユーザー
動画ワールドモデル、リアルタイムインタラクティブ動画生成、効率的な拡散蒸留技術に取り組む研究者および開発者向けです。
主な特徴
- 高い効率性:1ステップおよび2ステップのフレーム単位モデルをサポートし、極めて低いレイテンシを実現。
- 多様な生成:フレーム単位設定でT2VとI2Vの両方をネイティブにサポート。
- 長時間動画対応:Rolling Forcingなどの拡張と併用することで、数分レベルの長時間動画生成が可能。
- 改善されたダイナミクス:視覚的品質と運動ダイナミクスにおいて、Self Forcingを上回る性能を発揮。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト