SalesforceAIResearch/DiffusionDPO
Code for "Diffusion Model Alignment Using Direct Preference Optimization"
What it solves
このプロジェクトは、拡散モデル(Stable Diffusion など)を人間の好みに合わせる手法である Diffusion-DPO の訓練コードを提供します。開発者が画像生成モデルを微調整(fine-tune)することで、論文「Diffusion Model Alignment Using Direct Preference Optimization」の結果を再現、あるいは標準的な学習目標に頼るだけでなく、ユーザーが実際に好む画像を生成するようにモデルを調整可能にします。
How it works
このシステムは、拡散モデルのための Direct Preference Optimization (DPO) を実装しています。学習済みモデル(Stable Diffusion 1.5 や SDXL)を入力とし、好みの画像と好ましくない画像のデータセットを使用して微調整を行います。PickScore、HPS、Aesthetics、CLIP などのスコアリングモデルを介した AI フィードバック機能も含まれており、生成された画像の品質とアライメントを評価します。
Who it’s for
DPO を用いて画像生成モデルを人間の好みに合わせる研究者や機械学習エンジニア、または学術論文「Diffusion Model Alignment Using Direct Preference Optimization」の結果を再現したいと考えている方向けです。
Highlights
- Support for Multiple Models: Compatible with Stable Diffusion 1.5 and Stable Diffusion XL (SDXL).
- AI Feedback Integration: Built-in support for scoring models including PickScore, HPS, Aesthetics, and CLIP.
- Flexible Training: Includes scripts for both DPO and standard Supervised Fine-Tuning (SFT).
- Pretrained Checkpoints: Provides access to DPO-aligned versions of SD1.5 and SDXL.