thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

What it solves

TurboDiffusion 解决了视频扩散模型高昂的计算成本和缓慢的生成速度问题。它显著降低了端到端生成的延迟,声称在保持视频质量的同时,在单张 RTX 5090 GPU 上可实现 100 到 200 倍的加速。

How it works

该框架通过结合三种主要技术来实现加速:

  • Attention Acceleration: 利用 SageAttention 和 Sparse-Linear Attention (SLA) 来优化注意力机制。
  • Timestep Distillation: 采用 rCM 进行时间步蒸馏,以减少所需的采样步数。
  • Quantization: 为线性层提供量化检查点(checkpoints),以便在 RTX 4090 和 5090 等消费级 GPU 上高效运行。

Who it’s for

该项目是为从事视频生成模型(特别是 Wan 系列)的开发人员和研究人员设计的,他们需要在使用几秒钟而非几分钟或几小时内生成高质量视频(480p 或 720p)的需求。

Highlights

  • Massive Speedup: 在 RTX 5090 上,将某些模型的生成时间从 184s 縮减至 1.9s。
  • SLA Support: 包含 SageSLA,这是一个基于 SageAttention 的快速 SLA 前向传播(forward pass)。
  • Flexible Modalities: 支持 Text-to-Video (T2V) 和 Image-to-Video (I2V) 生成。
  • Hardware Optimized: 为高端数据中心 GPU (H100) 和消费级 GPU (RTX 5090/4090) 提供特定的配置和检查点。"},