thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

What it solves

TurboDiffusionは、ビデオ拡散モデルの高コストな計算量と生成速度の遅さを解決します。ビデオの品質を維持しながら、単一のRTX 5090 GPU上で100倍から200倍の高速化を実現し、エンドツーエンドの生成遅延を大幅に削減します。

How it works

このフレームワークは、主に3つの技術を組み合わせて高速化を実現します:

  • Attention Acceleration: SageAttentionとSparse-Linear Attention (SLA) を利用してアテンションメカニズムを最適化します。
  • Timestep Distillation: rCMを用いてタイムステップ蒸留を行い、必要なサンプリングステップ数を削減します。
  • Quantization: 線形層に対して量子化チェックポイント(checkpoints)を提供し、RTX 4090や5090のようなコンシューマー向けGPUで効率的に動作させます。

Who it’s for

このプロジェクトは、ビデオ生成モデル(特にWanシリーズ)を扱う開発者や研究者で、高品質なビデオ(480pまたは720p)を数分や数時間ではなく、数秒で生成する必要がある方向けです。

Highlights

  • Massive Speedup: RTX 5090において、特定のモデルの生成時間を184sから1.9sに短縮します。
  • SLA Support: SageAttentionに基づいた高速なSLAフォワードパスであるSageSLAを含んでいます。
  • Flexible Modalities: Text-to-Video (T2V) と Image-to-Video (I2V) の両方の生成をサポートします。
  • Hardware Optimized: ハイエンドデータセンター向けGPU (H100) とコンシューマー向けGPU (RTX 5090/4090) の両方に特定の構成とチェックポイントを提供します。