modelscope/DiffSynth-Studio
Enjoy the magic of Diffusion models!
解決的問題
DiffSynth-Studio 是一個開源的擴散模型引擎,旨在簡化生成模型的部署與訓練。它透過先進的記憶體管理與量化技術,解決大型擴散模型通常所需的高硬體要求,使這些模型能在消費級 GPU 上運行。
如何運作
該框架整合了多種主流的開源擴散模型,涵蓋不同模態。它採用動態排程系統,將模型參數在磁碟、記憶體與 VRAM 之間移動,以優化資源使用。為進一步降低記憶體佔用,它支援參數量化(如 NF4 與 INT8)以及 CPU Offload 訓練,允許在訓練過程中逐層將模型權重在 CPU 與 GPU 之間移動。
適用對象
本工具適用於希望在有限硬體資源條件下執行生成模型推論或訓練(包括 LoRA 與 Adapter 模型)的開發者與研究人員,特別針對影像、影片與音訊生成任務。
主要亮點
- 多模態支援:整合影像、影片與音訊生成模型,以及影像品質度量模型。
- VRAM 管理:在磁碟、記憶體與 VRAM 之間動態排程參數,支援低 VRAM GPU。
- 高階量化:支援 NF4 與 INT8 量化,降低推論與訓練過程中的 VRAM 要求。
- 彈性訓練:支援基礎模型訓練、LoRA 與 Adapter 模型,包括使用計算圖推理引擎的專用「分片訓練」流程。
- CPU Offload 訓練:透過逐層在 CPU 與 GPU 之間移動權重,使在消費級 GPU 上訓練大型模型成為可能。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案