vvvvvjdy/D-OPSD

Official Repo of "D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models"

What it solves

D-OPSD 解決了在不丟失原始知識或僅需幾步即可生成高品質圖像的能力的情況下,持續微調步進式蒸餾擴散模型(專為快速、少步推理設計的模型)的挑戰。

How it works

D-OPSD 使用了一個在線策略自我蒸餾框架。該系統通過提供不同的上下文,為同一個模型分配兩個不同的角色——老師和學生。這使得模型能夠在其自身生成的輸出(roll-outs)上進行監督式微調,而無需外部獎勵函數或額外的模組。

Who it's for

D-OPSD 適用於從事文本到圖像擴散模型的開發者和研究人員,特別是那些使用 LLM/VLM 編碼器並希望在保持快速推理速度的同時,針對新概念、風格或領域偏好進行模型微調的人員。

Highlights

  • On-Policy Self-Distillation: 實現了使用模型自身生成的輸出進行監督式微調。
  • Preservation of Capability: 在微調期間保持了少步推理速度和先前的知識。
  • Versatile Application: 在不同設置下都得到了驗證,包括用於領域適應(例如:動漫)的全量微調,以及用於從有限數據中學習新概念的小規模 LoRA 訓練。
  • No External Rewards: 在無需外部獎勵函數或額外模組的情況下運行。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch