hao-ai-lab/FastVideo

A unified inference and post-training framework for accelerated video generation.

解決的問題

FastVideo 解決了與最先進的影片 Diffusion Transformers (DiTs) 相關的計算成本高與生成速度慢的問題。它提供了一個統一的框架,用於加速影片生成模型的訓練後階段(微調與蒸餾)以及即時推理。

工作原理

FastVideo 採用了多種優化技術來降低延遲並提高吞吐量:

  • 訓練後優化:支援全量與 LoRA 微調、用於逐步縮減的 Distribution Matching Distillation (DMD2),以及實現顯著去噪加速(超過 50 倍)的稀疏蒸餾(sparse distillation)。
  • 注意力機制:實現了 Video Sparse Attention (VSA) 與 Sliding Tile Attention,以降低影片模型中注意力機制的複雜度。
  • 推理加速:該框架利用序列並行(sequence parallelism)進行多 GPU 分散式推理,並整合了多種高性能注意力後端。
  • 因果蒸餾 (Causal Distillation):使用 "Self-Forcing" 為自回歸模型實現因果蒸餾。

適用對象

該框架專為需要降低推理延遲或優化訓練及蒸餾流水線的高性能影片生成模型構建者(AI 研究人員與開發人員)而設計。

亮點

  • 即時生成:包含用於即時影片串流與 "vibe directing"(互動式編輯)的平台 "Dreamverse"。
  • 高效率:能夠在單個 GPU 上在 4.5 秒內生成 5 秒 1080p 影片。
  • 廣泛的硬體支援:相容 NVIDIA GPU (H100, A100, 4090)、Apple Silicon (MPS) 以及 Linux、Windows 與 MacOS。
  • 可擴展訓練:支援用於大規模模型訓練的 FSDP2、序列並行與選擇性激活檢查點(selective activation checkpointing)。