vvvvvjdy/D-OPSD

Official Repo of "D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models"

What it solves

D-OPSD는 스텝 디스틸레이션 디퓨전 모델(빠르고 적은 단계의 인퍼런스를 위해 설계된 모델)이 원래의 지식을 잃거나 단 몇 단계만으로 고품질 이미지를 생성하는 능력을 잃지 않으면서 지속적으로 튜닝하는 데 따르는 문제를 해결합니다.

How it works

온폴리시 셀프 디스틸레이션 프레임워크를를 사용합니다. 이 시스템은 서로 다른 컨텍스트를 제공함으로써 동일한 모델에 교사자와 학생이라는 두 가지 다른 역할을 부여합니다. 이를 통해 모델은 외부 보상 함수나 추가 모듈 없이도 자신이 생성한 출력(roll-outs)에 대해 지도 학습 튜닝을 수행할 수 있습니다.

Who it's for

텍스트-투-이미지 디퓨전 모델을 연구하는 연구자 및 개발자, 특히 LLM/VLM 인코더를 사용하며 빠른 인퍼런스 속도를 유지하면서 새로운 개념, 스타일 또는 도메인 선호도를 위해 모델을 미세 조정하고 싶은 사람들을 대상으로 합니다.

Highlights

  • On-Policy Self-Distillation: 모델 자신의 출력을 사용하여 지도 학습 튜닝을 가능하게 합니다.
  • Preservation of Capability: 튜닝 과정 중에도 적은 단계의 인퍼런스 속도를 유지하고 이전의 지식을 유지합니다.
  • Versatile Application: 도메인 적응(예: 애니메이션)을 위한 전체 파인튜닝과 제한된 데이터로부터 새로운 개념을 학습하는 소규모 LoRA 훈련을 포함하여 다양한 설정에서 검증되었습니다.
  • No External Rewards: 외부 보상 함수나 추가 모듈 없이 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch