thu-ml/Causal-Forcing
[ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++
解決的問題
因果強制(Causal Forcing)解決了高品質、即時互動式影片生成的挑戰。它特別旨在相比現有方法(如 Self Forcing)提升自回歸(AR)擴散模型的視覺品質與運動動態,同時維持相同的訓練預算與推論效率。
工作原理
本專案實作多階段訓練流程,以建立高效的影片生成器:
- AR 擴散訓練:適用於區塊式與逐幀模型的基礎階段。
- 初始化:使用 因果 ODE(需 ODE 對應資料整理)或 因果一致性蒸餾(於 Causal Forcing++ 中提出,僅使用真實資料,無需 ODE 資料整理)對模型進行初始化。
- 非對稱 DMD:最終蒸餾階段,使模型能在極少步驟內(例如 1、2 或 4 步)生成高品質影片。
逐幀模型透過將第一個潛在幀視為條件影像,原生整合文本到影片(T2V)與影像到影片(I2V)的生成。
適用對象
適用於從事影片世界模型、即時互動式影片生成與高效擴散蒸餾技術的研究人員與開發者。
主要亮點
- 高效率:支援 1 步與 2 步的逐幀模型,實現極低延遲。
- 多功能生成:在逐幀設定中原生支援 T2V 與 I2V。
- 長影片支援:相容 Rolling Forcing 等擴充,可實現分鐘級長影片生成。
- 更優的動態表現:在視覺品質與運動動態方面優於 Self Forcing。
相關
- 專案
- 專案
- 專案
- 專案
- 專案