MeiGen-AI/OPSD-V

On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

何を解決するか

OPSD-V は、少数ステップの自己回帰(AR)動画生成モデルにおける誤差蓄積と弱まった運動ダイナミクスの問題に対処します。これらのモデルでは、1つの生成チャンク内の小さなアーティファクトや意味的ドリフトが、KVキャッシュに書き戻され、その後のすべてのチャンクの品質を低下させ、長期的な視覚品質が悪化します。

仕組み

Post-training にオンポリシー自己蒸留パラダイムを使用します。"学生"モデルは、実際のデプロイロールアウトと完全に同じように、チャンクを生成し、自身のKVキャッシュを更新します。一方、"教師"モデルは同じノイズ除去状態で評価されます。ただし、教師モデルには、実際の長時間動画のコンテキストから構築されたクリーンでAR整合性のある時系列キャッシュが提供されます。学生モデルの速度予測を教師モデルと一致させることで、モデルは元の少数ステップサンプラーまたは推論時キャッシュメカニズムを変更せずに、安定性を向上させる密な補正ターゲットを得ます。

対象ユーザー

自己回帰的動画生成に取り組んでいる研究者や開発者、特に少数ステップの拡散モデルの長期的安定性と運動品質を向上させたい人。

特徴

  • オンポリシー学生ロールアウト: 学生モデルは訓練中に実際の推論を模倣するために、自身の生成されたKVキャッシュを維持します。
  • クリーンな教師コンテキスト: 実際の動画履歴を使用して、教師モデルに高品質な参照を提供します。
  • 推論パスの維持: 元の4ステップARサンプラーを維持し、デプロイ時にレイテンシの増加がありません。
  • メモリ効率の良い訓練: チャンク単位の逆伝播、FSDP、LoRA/EMAサポートを実装し、長時間動画の訓練を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト