modelscope/DiffSynth-Studio

Enjoy the magic of Diffusion models!

What it solves

DiffSynth-Studio 提供一個統一的開源引擎,用於操作 Diffusion 模型,降低研究人員與開發者探索、訓練與部署生成式 AI 的技術門檻。它解決了整合各種前沿模型的複雜性,以及在訓練與推論時管理 GPU VRAM 等硬體限制的問題。

How it works

它是一個彈性的框架,支援包括文字生成圖像、圖像編輯、音訊生成影片、文字生成音樂等多種模態。引擎實作了先進的記憶體管理技術,如層級磁碟卸載與 CPU 卸載訓練,讓大型模型能在消費級硬體上運行。它同時提供名為「Diffusion Templates」的插件式框架,簡化可控生成模型的建立。

Who it’s for

  • Academic Researchers:針對積極的技術探索與最前沿模型能力的研究者。
  • AI Developers:希望快速實現「狂野想法」或將外部 Diffusion 模型整合到工作流程中的開發者。
  • Content Creators:想利用高效能生成模型進行圖像、影片與音訊合成的內容創作者。

Highlights

  • Broad Model Support:整合了包括 FLUX.2、Z-Image、Wan、LTX-2、Qwen-Image 在內的廣泛模型。
  • VRAM Optimization:具備 CPU 卸載訓練與層級磁碟卸載,降低 GPU 記憶體需求。
  • Advanced Training Tools:支援 Split Training(將資料處理與訓練分離)、Differential LoRA 與 FP8 精度訓練。
  • Multimodal Capabilities:支援文字生成圖像、圖像生成影片、音訊驅動影片生成與文字生成音樂。
  • Diffusion Templates:用於訓練可控生成模型的專門插件框架。