vvvvvjdy/D-OPSD
Official Repo of "D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models"
What it solves
D-OPSD 解决了在不丢失原始知识或其仅需几步即可生成高质量图像的能力的情况下,持续微调步进式蒸馏扩散模型(专为快速、少步推理设计的模型)的挑战。
How it works
D-OPSD 使用了一种在线策略自我蒸馏框架。该系统通过提供不同的上下文,使得同一个模型承担两个不同的角色——教师和学生。这允许模型对其自身生成的输出(roll-outs)进行监督式微调,,而无需外部奖励函数或额外的模块。
Who it's for
D-OPSD 适用于从事文本到图像扩散模型的开发人员和开发人员,特别是那些使用 LLM/VLM 编码器并希望在保持快速推理速度的同时,针对新概念、风格或领域偏好进行模型微调的人员。
Highlights
- On-Policy Self-Distillation: 实现了使用模型自身的输出进行监督式微调。
- Preservation of Capability: 在微调期间保持了少步精度的推理速度和先过的知识。
- Versatile Application: 在不同设置下都得到了验证,包括用于领域适应(例如:动漫)的全量微调,和用于从有限数据中学习新概念的小规模 LoRA 训练。
- No External Rewards: 在无需外部奖励函数或额外的模块的情况下运行。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch