hao-ai-lab/FastVideo

A unified inference and post-training framework for accelerated video generation.

解决的问题

FastVideo 解决了与最先进的视频 Diffusion Transformers (DiTs) 相关的计算成本高和生成速度慢的问题。它提供了一个统一的框架,用于加速视频生成模型的训练后阶段(微调和蒸馏)以及实时推理。

工作原理

FastVideo 采用了多种优化技术来降低延迟并提高吞吐量:

  • 训练后优化:支持全量和 LoRA 微调、用于逐步缩减的 Distribution Matching Distillation (DMD2),以及实现显著去噪加速(超过 50 倍)的稀疏蒸馏(sparse distillation)。
  • 注意力机制:实现了 Video Sparse Attention (VSA) 和 Sliding Tile Attention,以降低视频模型中注意力机制的复杂度。
  • 推理加速:该框架利用序列并行(sequence parallelism)进行多 GPU 分布式推理,并集成了多种高性能注意力后端。
  • 因果蒸馏 (Causal Distillation):使用 "Self-Forcing" 为自回归模型实现因果蒸馏。

适用对象

该框架专为需要降低推理延迟或优化训练及蒸馏流水线的高性能视频生成模型构建者(AI 研究人员和开发人员)而设计。

亮点

  • 实时生成:包含用于实时视频流和 "vibe directing"(交互式编辑)的平台 "Dreamverse"。
  • 高效率:能够在单个 GPU 上在 4.5 秒内生成 5 秒 1080p 视频。
  • 广泛的硬件支持:兼容 NVIDIA GPU (H100, A100, 4090)、Apple Silicon (MPS) 以及 Linux、Windows 和 MacOS。
  • 可扩展训练:支持用于大规模模型训练的 FSDP2、序列并行和选择性激活检查点(selective activation checkpointing)。