thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

解決する課題

TurboDiffusionは、ビデオ拡散モデルの高コストな計算量と遅い生成速度の問題を解決します。元のビデオ品質を維持しようと試みながら、単一のRTX 5090においてエンドツーエンドの生成レイテンシを100倍から200倍に大幅に短縮します。

仕組み

このフレームワークは、主に3つの技術を組み合わせることで加速を実現します:

  • Attention Acceleration: SageAttentionとSparse-Linear Attention (SLA) を利用してアテンションメカニズムを高速化します。
  • Timestep Distillation: rCMを用いたタイムステップ蒸留を採用し、必要なサンプリングステップ数を削減します。
  • Quantization: 線形層に対して量子化されたチェックポイントを提供し、RTX 4090や5090のようなコンシューマ向けGPUでの高性能生成を可能にします。

対象者

単一のGPUでほぼ瞬時の推論速度を必要とする、ビデオ生成モデル(特にWanシリーズ)を扱う開発者や研究者向けに設計されています。

ハイライト

  • 大幅な高速化: RTX 5090において、特定のモデルの生成時間を184秒から1.9秒に短縮します。
  • 多用途なサポート: Text-to-Video (T2V) と Image-to-Video (I2V) の両方のワークフローをサポートしています。
  • 柔軟な解像度: 480pおよび720pの解像度でのビデオ生成が可能です。
  • マルチGPU互換性: さまざまなハードウェア(例:RTXシリーズ vs H100)に適応できるよう、量子化済みおよび未量子化のチェックポイントの両方を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト