diffusion-pipe: 用于大规模图像和视频扩散模型的流水线并行训练框架

它解决了什么

它通过使用流水线并行性使得训练那些在单个 GPU 上无法容纳的巨大扩散模型成为可能。它提供了一个统一的框架来训练图像和视频生成模型,从而降低了管理不同架构的复杂性。

它是如何工作的

该项目通过 DeepSpeed 使用数据和流水线并行的混合方式,将模型分布到多个 GPU 上。为了优化显存使用,它实现了将潜在表示和文本嵌入预先缓存到磁盘,以便在实际训练过程中卸载 VAE 和文本编码器。它还支持诸如 8 位优化器、块交换和激活检查点等节省内存的技术。

它适用于谁

需要微调或训练大规模图像和视频扩散模型(如 Flux、SDXL 或 HunyuanVideo)的人工智能研究人员和开发者,他们缺乏单个巨大 GPU 的显存。

亮点

  • 广泛模型支持:兼容包括 SDXL、Flux、LTX-Video、HunyuanVideo、Cosmos 和 Wan2.1 在内的多种现代模型。
  • 流水线并行:专门设计用于处理大于单个 GPU 显存的模型。
  • 统一图像/视频工作流:在单个训练脚本中支持两种模态。
  • 高效缓存:多进程、多 GPU 预先缓存嵌入和潜在表示,以加速训练并节省内存。
  • 训练管理:包括 TensorBoard 日志、在保留集上的评估以及用于恢复训练的状态检查点。

Sources