thu-ml/TurboDiffusion
TurboDiffusion: 100–200× Acceleration for Video Diffusion Models
解决的问题
TurboDiffusion 解决了视频扩散模型计算成本高和生成速度慢的问题。在保持原始视频质量的同时,它能显著降低端到端生成延迟——在单张 RTX 5090 上可实现 100 到 200 倍的加速。
工作原理
该框架通过结合三种主要技术实现加速:
- Attention Acceleration: 利用 SageAttention 和 Sparse-Linear Attention (SLA) 来加速注意力机制。
- Timestep Distillation: 采用 rCM 进行时间步蒸留,以减少所需的采样步数。
- Quantization: 为线性层提供量化后的检查点,从而在 RTX 4090 和 5090 等消费级 GPU 上实现高性能生成。
适用对象
专为需要单 GPU 近乎即时推理速度的视频生成模型(特别是 Wan 系列)的开发人员和研究人员设计。
亮点
- 大幅提速: 在 RTX 5090 上,将某些模型的生成时间从 184 秒缩短至 1.9 秒。
- 多功能支持: 支持 Text-to-Video (T2V) 和 Image-to-Video (I2V) 工作流。
- 灵活的分辨率: 能够生成 480p 和 720p 分辨率的视频。
- 多 GPU 兼容性: 提供量化和未量化的检查点,以适应不同的硬件(例如 RTX 系列 vs H100)。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目