modelscope/DiffSynth-Studio

Enjoy the magic of Diffusion models!

解决的问题

DiffSynth-Studio 是一个开源的扩散模型引擎,旨在简化生成模型的部署和训练。它通过提供先进的内存管理和量化技术,解决了大型扩散模型通常所需的高硬件要求,使这些模型能够在消费级 GPU 上运行。

如何工作

该框架集成了多种主流的开源扩散模型,涵盖不同模态。它采用动态调度系统,将模型参数在磁盘、内存和 VRAM 之间移动,以优化资源使用。为进一步降低内存占用,它支持参数量化(如 NF4 和 INT8)以及 CPU Offload 训练,允许在训练过程中逐层将模型权重在 CPU 和 GPU 之间移动。

适用人群

本工具适用于希望在有限硬件资源条件下运行生成模型的推断或训练(包括 LoRA 和 Adapter 模型)的开发者和研究人员,尤其针对图像、视频和音频生成任务。

主要亮点

  • 多模态支持:集成图像、视频和音频生成模型,以及图像质量度量模型。
  • VRAM 管理:在磁盘、内存和 VRAM 之间动态调度参数,支持低 VRAM GPU。
  • 高级量化:支持 NF4 和 INT8 量化,降低推理和训练过程中的 VRAM 要求。
  • 灵活训练:支持基础模型训练、LoRA 和 Adapter 模型,包括使用计算图推理引擎的专用「分片训练」流程。
  • CPU Offload 训练:通过逐层在 CPU 和 GPU 之间移动权重,使在消费级 GPU 上训练大型模型成为可能。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目