NVlabs/rcm

rCM & Causal-rCM: Leading and Unified Algorithms/Infrastructures for Bidirectional/Autoregressive Video Diffusion Distillation at Scale

何を解決するか

rCM は、少数ステップでの動画生成における品質と多様性のボトルネックを克服します。具体的には、従来の連続時間一貫性蒸留法(sCMなど)の限界を、オフラインの前方発散(forward-divergence)とオンポリシーの逆KL(reverse-KL)の蒸留フレームワークを組み合わせることで克服し、高い視覚的品質を維持しながら、元の教師モデルの多様性を保ちます。

動作方法

本プロジェクトは、スコア正則化された連続時間一貫性モデルを実装しています。一貫性モデル(CM)と拡散モデル蒸留(DMD)を補完するジョイント蒸留フレームワークを使用し、わずか2〜4ステップのサンプリングで高品質な動画生成を可能にします。

ストリーミング動画やインタラクティブな世界モデル向けに、Causal-rCM を導入。教師強制(前方発散)と自己強制(逆方向発散)のトレーニングスタックを統合し、自己回帰的動画拡散蒸留をサポートします。

対象ユーザー

動画拡散モデルの研究開発に従事するAI研究者およびエンジニア。特に、大規模モデル(10B+パラメータ)への蒸留スケーリング、ストリーミング動画生成、インタラクティブな世界モデルの開発を検討している人向けです。

主な特徴

  • 少数ステップ生成: 1〜4ステップで高品質で多様な動画を生成可能。
  • スケーラブルなインフラ: FSDP2、Ulysses Context Parallel(CP)、Selective Activation Checkpointing(SAC)を活用し、10B+パラメータモデルへのスケーリングをサポート。
  • カスタムカーネル: オープンソースの FlashAttention-2 ヤコビアン・ベクトル積(JVP)カーネルを提供。
  • 因果拡張: 自己回帰トレーニングの統一されたレシピを提供。量子化されたKVキャッシュと長さの外挿を最適化した因果推論を含む。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト