vvvvvjdy/D-OPSD

Official Repo of "D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models"

What it solves

D-OPSDは、ステップ蒸留拡散モデル(高速かつ少ステップ推論用に設計されたモデル)が、元の知識や数ステップで高品質な画像を生成する能力を失うことなく、継続的にチューニングされるという課題を解決します。

How it works

オンポリシー自己蒸留フレームワークを使用します。このシステムは、異なるコンテキストを提供することで、同じモデルに教師と生徒の2つの異なる役割を役割を割り当てます。これにより、モデルは外部の報酬関数や追加のモジュールなしで、自身が生成した出力(roll-outs)に対して教師付きチューニングを行えます。

Who it's for

テキストから画像への拡散モデルを研究している研究者や開発者、特にLLM/VLMエンコーダーを使用しており、高速推論速度を維持しながら、新しい概念、スタイル、またはドメインの好みを微調整するためのモデルを微調整したいと考えている人々です。

Highlights

  • On-Policy Self-Distillation: モデル自身の出力を使用して、教師付きチューニングを可能にします。
  • Preservation of Capability: チューニング中、少ステップ推論速度と以前の知識を維持します。
  • ** Versatile Application**: さまざまな設定で検証済みです。ドメイン適応(例:アニメ)のためのフルファインチューニング、および限定的なデータから新しい概念を維持するための小規模なLoRAトレーニングを含みます。
  • No External Rewards: 外部の報酬関数や追加のモジュールを必要とせずに動作します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch