hao-ai-lab/FastVideo

A unified inference and post-training framework for accelerated video generation.

해결하는 문제

FastVideo는 최첨단 비디오 Diffusion Transformers (DiTs)와 관련된 높은 계산 비용 및 느린 생성 속도 문제를 해결합니다. 비디오 생성 모델의 포스트 트레이닝(미세 조정 및 증류)과 실시간 추론 모두를 가속화하기 위한 통합 프레임워크를 제공합니다.

작동 원리

FastVideo는 지연 시간을 줄이고 처리량을 높이기 위해 여러 최적화 기술을 사용합니다:

  • 포스트 트레이닝 최적화: 전체 및 LoRA 미세 조정을 지원하며, 단계적 축소를 위한 Distribution Matching Distillation (DMD2) 및 상당한 디노이징 속도 향상(50배 이상)을 위한 희소 증류(sparse distillation)를 지원합니다.
  • 어텐션 메커니즘: Video Sparse Attention (VSA) 및 Sliding Tile Attention을 구현하여 비디오 모델의 어텐션 메커니즘 복잡성을 줄입니다.
  • 추론 가속: 프레임워크는 여러 GPU에 걸친 분산 추론을 위한 시퀀스 병렬성(sequence parallelism)을 활용하고 여러 고성능 어텐션 백엔드를 통합합니다.
  • 인과적 증류 (Causal Distillation): "Self-Forcing"을 사용하여 자기 회귀 모델을 위한 인과적 증류를 가능하게 합니다.

대상 사용자

이 프레임워크는 추론 지연 시간을 줄이거나 훈련 및 증류 파이프라인을 최적화해야 하는 고성능 비디오 생성 모델을 구축하는 AI 연구자 및 개발자를 위해 설계되었습니다.

주요 특징

  • 실시간 생성: 실시간 비디오 스트리밍 및 "vibe directing"(대화형 편집)을 위한 플랫폼인 "Dreamverse"가 포함되어 있습니다.
  • 높은 효율성: 단일 GPU에서 5초 1080p 비디오를 4.5초 만에 생성할 수 있습니다.
  • 폭넓은 하드웨어 지원: NVIDIA GPU (H100, A100, 4090), Apple Silicon (MPS), 그리고 Linux, Windows, MacOS와 호환됩니다.
  • 확장 가능한 훈련: 대규모 모델 훈련을 위해 FSDP2, 시퀀스 병렬성 및 선택적 액티베이션 체크포인팅을 지원합니다.