thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

解决的问题

TurboDiffusion 解决了视频扩散模型计算成本高和生成速度慢的问题。在保持原始视频质量的同时,它能显著降低端到端生成延迟——在单张 RTX 5090 上可实现 100 到 200 倍的加速。

工作原理

该框架通过结合三种主要技术实现加速:

  • Attention Acceleration: 利用 SageAttention 和 Sparse-Linear Attention (SLA) 来加速注意力机制。
  • Timestep Distillation: 采用 rCM 进行时间步蒸留,以减少所需的采样步数。
  • Quantization: 为线性层提供量化后的检查点,从而在 RTX 4090 和 5090 等消费级 GPU 上实现高性能生成。

适用对象

专为需要单 GPU 近乎即时推理速度的视频生成模型(特别是 Wan 系列)的开发人员和研究人员设计。

亮点

  • 大幅提速: 在 RTX 5090 上,将某些模型的生成时间从 184 秒缩短至 1.9 秒。
  • 多功能支持: 支持 Text-to-Video (T2V) 和 Image-to-Video (I2V) 工作流。
  • 灵活的分辨率: 能够生成 480p 和 720p 分辨率的视频。
  • 多 GPU 兼容性: 提供量化和未量化的检查点,以适应不同的硬件(例如 RTX 系列 vs H100)。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目