hao-ai-lab/FastVideo
A unified inference and post-training framework for accelerated video generation.
解決する課題
FastVideoは、最先端の動画Diffusion Transformers (DiTs) に伴う高い計算コストと生成速度の遅延に対処します。動画生成モデルのポストトレーニング(ファインチューニングおよび蒸留)とリアルタイム推論の両方を加速するための統合フレームワークを提供します。
仕組み
FastVideoは、レイテンシを低減しスループットを向上させるために、いくつかの最適化技術を採用しています:
- ポストトレーニングの最適化: フルファインチューニングおよびLoRAファインチューニング、段階的な削減のためのDistribution Matching Distillation (DMD2)、および大幅なデノイジングの高速化(50倍以上)を実現する疎な蒸留(sparse distillation)をサポートしています。
- アテンションメカニズム: Video Sparse Attention (VSA) と Sliding Tile Attention を実装し、動画モデルにおけるアテンションメカニズムの複雑さを軽減します。
- 推論の加速: フレームワークは、複数のGPUにわたる分散推論のためのシーケンス並列(sequence parallelism)を利用し、複数の高性能なアテンションバックエンドを統合しています。
- 因果的蒸留 (Causal Distillation): 「Self-Forcing」を使用して、自己回帰モデルの因果的蒸留を可能にします。
対象者
このフレームワークは、推論レイテンシの低減や、トレーニングおよび蒸留パイプラインの最適化を必要とする、高性能な動画生成モデルを構築するAI研究者および開発者向けに設計されています。
ハイライト
- リアルタイム生成: リアルタイム動画ストリーミングと「vibe directing」(インタラクティブ編集)のためのプラットフォームである「Dreamverse」が含まれています。
- 高効率: 単一のGPUで5秒間の1080p動画を4.5秒で生成可能です。
- 幅広いハードウェアサポート: NVIDIA GPU (H100, A100, 4090)、Apple Silicon (MPS)、および Linux、Windows、MacOS に対応しています。
- スケーラブルなトレーニング: 大規模なモデルトレーニングのために、FSDP2、シーケンス並列、および選択的アクティベーション・チェックポインティングをサポートしています。