tdrussell/diffusion-pipe

A pipeline parallel training script for diffusion models.

What it solves

它透過管線平行化,使得過於龐大而無法在單一 GPU 上容納的擴散模型得以訓練。提供一個統一的框架,同時支援影像與影片生成模型,降低管理不同架構的複雜度。

How it works

此專案使用 DeepSpeed 的資料與管線平行混合方式,將模型分散至多個 GPU。為了最佳化 VRAM 使用,實作了將潛在向量與文字嵌入預先快取至磁碟的機制,使 VAE 與文字編碼器在實際訓練時可以卸載。亦支援 8 位元優化器、區塊交換、激活檢查點等省記憶體技術。

Who it’s for

需要微調或訓練大規模影像與影片擴散模型(如 Flux、SDXL、或 HunyuanVideo)的 AI 研究者與開發者,且手頭的單一大型 GPU 記憶體不足。

Highlights

  • Broad Model Support: 相容於眾多現代模型,包括 SDXL、Flux、LTX-Video、HunyuanVideo、Cosmos 與 Wan2.1。
  • Pipeline Parallelism: 專為處理超過單一 GPU 記憶體上限的模型而設計。
  • Unified Image/Video Workflow: 在同一訓練腳本中同時支援影像與影片兩種模式。
  • Efficient Caching: 多程序、多 GPU 預快取嵌入與潛在向量,加速訓練並節省記憶體。
  • Training Management: 包含 Tensorboard 日誌、在保留測試集上的評估,以及可供恢復訓練的狀態檢查點。