modelscope/DiffSynth-Studio

Enjoy the magic of Diffusion models!

解決的問題

DiffSynth-Studio 是一個開源的擴散模型引擎,旨在簡化生成模型的部署與訓練。它透過先進的記憶體管理與量化技術,解決大型擴散模型通常所需的高硬體要求,使這些模型能在消費級 GPU 上運行。

如何運作

該框架整合了多種主流的開源擴散模型,涵蓋不同模態。它採用動態排程系統,將模型參數在磁碟、記憶體與 VRAM 之間移動,以優化資源使用。為進一步降低記憶體佔用,它支援參數量化(如 NF4 與 INT8)以及 CPU Offload 訓練,允許在訓練過程中逐層將模型權重在 CPU 與 GPU 之間移動。

適用對象

本工具適用於希望在有限硬體資源條件下執行生成模型推論或訓練(包括 LoRA 與 Adapter 模型)的開發者與研究人員,特別針對影像、影片與音訊生成任務。

主要亮點

  • 多模態支援:整合影像、影片與音訊生成模型,以及影像品質度量模型。
  • VRAM 管理:在磁碟、記憶體與 VRAM 之間動態排程參數,支援低 VRAM GPU。
  • 高階量化:支援 NF4 與 INT8 量化,降低推論與訓練過程中的 VRAM 要求。
  • 彈性訓練:支援基礎模型訓練、LoRA 與 Adapter 模型,包括使用計算圖推理引擎的專用「分片訓練」流程。
  • CPU Offload 訓練:透過逐層在 CPU 與 GPU 之間移動權重,使在消費級 GPU 上訓練大型模型成為可能。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案