thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

解決的問題

TurboDiffusion 解決了影片擴散模型計算成本高與生成速度慢的問題。在嘗試維持原始影片品質的同時,它能顯著降低端到端生成延遲——在單張 RTX 5090 上可實現 100 到 200 倍的加速。

工作原理

該框架透過結合三種主要技術實現加速:

  • Attention Acceleration: 利用 SageAttention 與 Sparse-Linear Attention (SLA) 來加速注意力機制。
  • Timestep Distillation: 採用 rCM 進行時間步蒸餾,以減少所需的採樣步數。
  • Quantization: 為線性層提供量化後的檢查點,從而在 RTX 4090 與 5090 等消費級 GPU 上實現高性能生成。

適用對象

專為需要單 GPU 近乎即時推理速度的影片生成模型(特別是 Wan 系列)的開發人員與研究人員設計。

亮點

  • 大幅提速: 在 RTX 5090 上,將某些模型的生成時間從 184 秒縮短至 1.9 秒。
  • 多功能支持: 支持 Text-to-Video (T2V) 與 Image-to-Video (I2V) 工作流。
  • 靈活的分辨率: 能夠生成 480p 與 720p 解析度的影片。
  • 多 GPU 兼容性: 提供量化與未量化的檢查點,以適應不同的硬體(例如 RTX 系列 vs H100)。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案