tdrussell/diffusion-pipe
A pipeline parallel training script for diffusion models.
What it solves
它透過管線平行化,使得過於龐大而無法在單一 GPU 上容納的擴散模型得以訓練。提供一個統一的框架,同時支援影像與影片生成模型,降低管理不同架構的複雜度。
How it works
此專案使用 DeepSpeed 的資料與管線平行混合方式,將模型分散至多個 GPU。為了最佳化 VRAM 使用,實作了將潛在向量與文字嵌入預先快取至磁碟的機制,使 VAE 與文字編碼器在實際訓練時可以卸載。亦支援 8 位元優化器、區塊交換、激活檢查點等省記憶體技術。
Who it’s for
需要微調或訓練大規模影像與影片擴散模型(如 Flux、SDXL、或 HunyuanVideo)的 AI 研究者與開發者,且手頭的單一大型 GPU 記憶體不足。
Highlights
- Broad Model Support: 相容於眾多現代模型,包括 SDXL、Flux、LTX-Video、HunyuanVideo、Cosmos 與 Wan2.1。
- Pipeline Parallelism: 專為處理超過單一 GPU 記憶體上限的模型而設計。
- Unified Image/Video Workflow: 在同一訓練腳本中同時支援影像與影片兩種模式。
- Efficient Caching: 多程序、多 GPU 預快取嵌入與潛在向量,加速訓練並節省記憶體。
- Training Management: 包含 Tensorboard 日誌、在保留測試集上的評估,以及可供恢復訓練的狀態檢查點。