thu-ml/TurboDiffusion
TurboDiffusion: 100–200× Acceleration for Video Diffusion Models
解決的問題
TurboDiffusion 解決了影片擴散模型計算成本高與生成速度慢的問題。在嘗試維持原始影片品質的同時,它能顯著降低端到端生成延遲——在單張 RTX 5090 上可實現 100 到 200 倍的加速。
工作原理
該框架透過結合三種主要技術實現加速:
- Attention Acceleration: 利用 SageAttention 與 Sparse-Linear Attention (SLA) 來加速注意力機制。
- Timestep Distillation: 採用 rCM 進行時間步蒸餾,以減少所需的採樣步數。
- Quantization: 為線性層提供量化後的檢查點,從而在 RTX 4090 與 5090 等消費級 GPU 上實現高性能生成。
適用對象
專為需要單 GPU 近乎即時推理速度的影片生成模型(特別是 Wan 系列)的開發人員與研究人員設計。
亮點
- 大幅提速: 在 RTX 5090 上,將某些模型的生成時間從 184 秒縮短至 1.9 秒。
- 多功能支持: 支持 Text-to-Video (T2V) 與 Image-to-Video (I2V) 工作流。
- 靈活的分辨率: 能夠生成 480p 與 720p 解析度的影片。
- 多 GPU 兼容性: 提供量化與未量化的檢查點,以適應不同的硬體(例如 RTX 系列 vs H100)。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案