hao-ai-lab/FastVideo

A unified inference and post-training framework for accelerated video generation.

何を解決するか

FastVideoは、ポストトレーニングとリアルタイム推論の両方のための統一されたフレームワークを提供することで、ビデオ生成を加速させるように設計されています。高解像度のビデオ拡散モデルに通常伴う高い計算コストと生成速度の遅さを解決します。

仕組み

このフレームワークは、レイテンシを低減し、スループットを向上させるために、いくつかの最適化技術を採用しています:

  • ポストトレーニングと蒸留: ビデオDiTのフルおよびLoRAファインチューニングをサポートし、Distribution Matching Distillation (DMD2) やスパース蒸留を使用して、大幅なデノイジングの高速化(50倍以上)を実現します。
  • アテンションの最適化: Video Sparse Attention (VSA) と Sliding Tile Attention を実装して、アテンションメカニズムの複雑さを軽減します。
  • 推論の加速: 分散推論のためにシーケンス並列性を利用し、複数の高性能なアテンションバックエンドをサポートします。
  • ハードウェアの互換性: NVIDIA GPU (H100, A100, 4090) や Apple Silicon (MLX経由) を含む、幅広いハードウェア向けに最適化されています。

対象者

ビデオ生成モデルを構築しているAI研究者や開発者、およびリアルタイムのビデオ生成や編集アプリケーション(含まれている Dreamverse プラットフォームなど)をデプロイしようとしている人々を対象としています。

ハイライト

  • リアルタイム機能: 「vibe directing」とリアルタイムのビデオストリーミングのための Dreamverse を含みます。
  • 極端な高速化: スパース蒸留技術により、50倍以上のデノイジング高速化を実現できます。
  • 幅広いハードウェアサポート: Linux, Windows, macOS (Apple Silicon) をネイティブにサポートします。
  • 包括的なツール群: データの前処理からトレーニング/ファインチューニング、最適化された推論までの完全なパイプラインを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト