thu-ml/TurboDiffusion
TurboDiffusion: 100–200× Acceleration for Video Diffusion Models
What it solves
TurboDiffusion 解决了视频扩散模型高昂的计算成本和缓慢的生成速度问题。它显著降低了端到端生成的延迟,声称在保持视频质量的同时,在单张 RTX 5090 GPU 上可实现 100 到 200 倍的加速。
How it works
该框架通过结合三种主要技术来实现加速:
- Attention Acceleration: 利用 SageAttention 和 Sparse-Linear Attention (SLA) 来优化注意力机制。
- Timestep Distillation: 采用 rCM 进行时间步蒸馏,以减少所需的采样步数。
- Quantization: 为线性层提供量化检查点(checkpoints),以便在 RTX 4090 和 5090 等消费级 GPU 上高效运行。
Who it’s for
该项目是为从事视频生成模型(特别是 Wan 系列)的开发人员和研究人员设计的,他们需要在使用几秒钟而非几分钟或几小时内生成高质量视频(480p 或 720p)的需求。
Highlights
- Massive Speedup: 在 RTX 5090 上,将某些模型的生成时间从 184s 縮减至 1.9s。
- SLA Support: 包含 SageSLA,这是一个基于 SageAttention 的快速 SLA 前向传播(forward pass)。
- Flexible Modalities: 支持 Text-to-Video (T2V) 和 Image-to-Video (I2V) 生成。
- Hardware Optimized: 为高端数据中心 GPU (H100) 和消费级 GPU (RTX 5090/4090) 提供特定的配置和检查点。"},