thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

What it solves

TurboDiffusion 解決了影片擴散模型高昂的計算成本與緩慢的生成速度問題。它顯著降低了端到端生成的延遲,聲稱在維持影片品質的同時,於單張 RTX 5090 GPU 上可實現 100 到 200 倍的加速。

How it works

該框架透過結合三種主要技術來實現加速:

  • Attention Acceleration: 使用 SageAttention 與 Sparse-Linear Attention (SLA) 來優化注意力機制。
  • Timestep Distillation: 採用 rCM 進行時間步蒸餾,以減少所需的採樣步數。
  • Quantization: 為線性層提供量化檢查點(checkpoints),以便在 RTX 4090 與 5090 等消費級 GPU 上高效運行。

Who it’s for

此專案是為開發者與研究人員設計的,特別是針對使用影片生成模型(特別是 Wan 系列)的人員,他們需要將生成高品質影片(480p 或 720p)的時間從數分鐘或數小時縮短至數秒鐘。

Highlights

  • Massive Speedup: 在 RTX 5090 上,將某些模型的生成時間從 184s 縮短至 1.9s。
  • SLA Support: 包含 SageSLA,這是一個基於 SageAttention 的快速 SLA 前向傳播(forward pass)。
  • Flexible Modalities: 支援 Text-to-Video (T2V) 與 Image-to-Video (I2V) 生成。
  • Hardware Optimized: 為高階數據中心 GPU (H100) 與消費級 GPU (RTX 5090/4090) 提供特定的配置與檢查點。"},