NVlabs/rcm

rCM & Causal-rCM: Leading and Unified Algorithms/Infrastructures for Bidirectional/Autoregressive Video Diffusion Distillation at Scale

解決的問題

rCM 解決了少步數影片生成中的品質與多樣性瓶頸。具體而言,它透過結合離線前向發散(forward-divergence)與在策略反KL(reverse-KL)蒸餾框架,克服了現有連續時間一致性蒸餾方法(如 sCM)的限制,從而於保持高視覺品質的同時,保留原始教師模型的多樣性。

工作原理

本專案實作了一種得分正則化的連續時間一致性模型。它採用聯合蒸餾框架,補足一致性模型(CM)與擴散模型蒸餾(DMD),僅需 2 到 4 次採樣步驟即可實現高品質影片生成。

針對串流影片與互動式世界模型,引入了 Causal-rCM,該模型整合了教師強制(前向發散)與自強制(反向發散)訓練堆疊,以支援自回歸影片擴散蒸餾。

適用對象

從事影片擴散模型研究與開發的 AI 研究人員與工程師,特別是那些希望將蒸餾擴展至大型模型(10B+ 參數)或開發串流影片生成與互動式世界模型的人。

主要亮點

  • 少步生成:在 1–4 步內生成高品質、多樣化的影片。
  • 可擴展基礎設施:利用 FSDP2、Ulysses Context Parallel (CP) 與 Selective Activation Checkpointing (SAC) 支援擴展至 10B+ 參數模型。
  • 自訂內核:包含開源的 FlashAttention-2 雅可比向量積(JVP)內核。
  • 因果擴展:提供統一的自回歸訓練方案,包含優化的因果推論(量化 KV 快取與長度外推)。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案