diffusion-pipe: 大規模圖像與視訊擴散模型的管線平行訓練框架
它解決的問題
它透過使用管線平行使得無法放在單一 GPU 上的巨型擴散模型得以訓練。它提供了一個統一的框架來訓練圖像與視訊生成模型,降低了管理不同架構的複雜性。
它是如何運作的
該專案透過 DeepSpeed 使用資料與管線平行的混合方式,將模型分配到多個 GPU 上。為了優化 VRAM 使用量,它實作了將潛在表示(latents)和文字嵌入預先快取到磁碟,這使得 VAE 和文字編碼器能在實際訓練過程中被卸載。它也支援如 8-bit 優化器、區塊交換和激活檢查點等節省記憶體的技術。
適合對象
需要微調或訓練大規模圖像與視訊擴散模型(如 Flux、SDXL 或 HunyuanVideo)的 AI 研究人員與開發者,且缺乏單一巨型 GPU 的 VRAM。
特點
- 廣泛模型支援:相容於多種現代模型,包括 SDXL、Flux、LTX-Video、HunyuanVideo、Cosmos 與 Wan2.1。
- 管線平行:專門設計用於處理大於單一 GPU 記憶體的模型。
- 統一圖像/視訊工作流程:在單一訓練腳本中支援兩種模態。
- 高效快取:多進程、多 GPU 的嵌入與潛在表示預先快取,以加速訓練並節省記憶體。
- 訓練管理:包含 Tensorboard 日誌、在保留集上的評估,以及狀態檢查點以恢復訓練。