SalesforceAIResearch/DiffusionDPO
Code for "Diffusion Model Alignment Using Direct Preference Optimization"
What it solves
该项目提供了 Diffusion-DPO 的训练代码,这是一种将扩散模型(如 Stable Diffusion)与人类偏好对齐的方法。它允许开发者微调图像生成模型,使其生成的图像能更好地符合用户的实际偏好,而不是仅仅依赖于标准的训练目标。
How it works
该系统实现了对扩散模型的直接偏好优化(DPO)。它采用预训练模型(如 Stable Diffusion 1.5 或 SDXL)并使用偏好与非偏好图像的数据集进行微调。它包含了用于 AI 反馈的工具,通过 PickScore、HPS、Aesthetics 和 CLIP 等评分模型来评估生成图像的质量与对齐程度。
Who it’s for
想要使用 DPO 将图像生成模型与人类偏好对齐的研究人员和机器学习工程师,或者正在寻找复制「Diffusion Model Alignment Using Direct Preference Optimization」学术论文结果的人。 extightening
Highlights
- Support for Multiple Models: Compatible with Stable Diffusion 1.5 and Stable Diffusion XL (SDXL).
- Direct AI Feedback Integration: Built-in support for scoring models including PickScore, HPS, HPS, Aesthetics, and CLIP.
- Flexible Training: Includes scripts for both DPO and standard Supervised Fine-Tuning (SFT).
- Pretrained Checkpoints: Provides access to DPO-aligned versions of SD1.5 and SDXL.