SalesforceAIResearch/DiffusionDPO

Code for "Diffusion Model Alignment Using Direct Preference Optimization"

What it solves

该项目提供了 Diffusion-DPO 的训练代码,这是一种将扩散模型(如 Stable Diffusion)与人类偏好对齐的方法。它允许开发者微调图像生成模型,使其生成的图像能更好地符合用户的实际偏好,而不是仅仅依赖于标准的训练目标。

How it works

该系统实现了对扩散模型的直接偏好优化(DPO)。它采用预训练模型(如 Stable Diffusion 1.5 或 SDXL)并使用偏好与非偏好图像的数据集进行微调。它包含了用于 AI 反馈的工具,通过 PickScore、HPS、Aesthetics 和 CLIP 等评分模型来评估生成图像的质量与对齐程度。

Who it’s for

想要使用 DPO 将图像生成模型与人类偏好对齐的研究人员和机器学习工程师,或者正在寻找复制「Diffusion Model Alignment Using Direct Preference Optimization」学术论文结果的人。 extightening

Highlights

  • Support for Multiple Models: Compatible with Stable Diffusion 1.5 and Stable Diffusion XL (SDXL).
  • Direct AI Feedback Integration: Built-in support for scoring models including PickScore, HPS, HPS, Aesthetics, and CLIP.
  • Flexible Training: Includes scripts for both DPO and standard Supervised Fine-Tuning (SFT).
  • Pretrained Checkpoints: Provides access to DPO-aligned versions of SD1.5 and SDXL.