SalesforceAIResearch/DiffusionDPO

Code for "Diffusion Model Alignment Using Direct Preference Optimization"

What it solves

이 프로젝트는 확산 모델(Stable Diffusion 등)을 인간의 선호도에 맞게 정렬하는 방법인 Diffusion-DPO의 학습 코드를 제공합니다. 개발자가 이미지 생성 모델을 미세 조정하여, 표준 학습 목표에만 의존하는 대신 사용자가 실제로 선호하는 이미지를 더 잘 생성하도록 할 수 있습니다.

How it works

이 시스템은 확산 모델을 위한 Direct Preference Optimization (DPO)을 구현합니다. 사전 학습된 모델(Stable Diffusion 1.5 또는 SDXL)을 가져와 선호되는 이미지와 선호되지 않는 이미지의 데이터셋을 사용하여 미세 조정합니다. PickScore, HPS, Aesthetics, 및 CLIP과 같은 스코어링 모델을 통한 AI 피드백 도구를 포함하여 생성된 이미지의 품질과 정렬 상태를 평가합니다.

Who it’s for

DPO를 사용하여 이미지 생성 모델을을 인간의 선호도에 맞게 정렬하려는 연구자나 머신러닝 엔지니어, 또는 학술 논문 "Diffusion Model Alignment Using Direct Preference Optimization"의 결과를 재현하고자 하는 분들을 위한 프로젝트입니다.

Highlights

  • Support for Multiple Models: Compatible with Stable Diffusion 1.5 and Stable Diffusion XL (SDXL).
  • AI Feedback Integration: Built-in support for scoring models including PickScore, HPS, Aesthetics, and CLIP.
  • Flexible Training: Includes scripts for both DPO and standard Supervised Fine-Tuning (SFT). *n

Highlights

  • Support for Multiple Models: Compatible with Stable Diffusion 1.5 and Stable Diffusion XL (SDXL).
  • AI Feedback Integration: Built-in support for scoring models including PickScore, HPS, Aesthetics, and CLIP.
  • Flexible Training: Includes scripts for both DPO and and for both DPO and standard Supervised Fine-Tuning (SFT).
  • Pretrained Checkpoints: Provides access to DPO-aligned versions of SD1.5 and SDXL.