thu-ml/TurboDiffusion
TurboDiffusion: 100–200× Acceleration for Video Diffusion Models
What it solves
TurboDiffusion는 비디오 확산 모델의 높은 계산 비용과 느린 생성 속도 문제를 해결합니다. 비디오 품질을 유지하면서 단일 RTX 5090 GPU에서 100배에서 200배의 속도 향상을 주장하며, 엔드투엔드 생성 지연 시간을 크게 줄입니다.
How it works
이 프레임워크는 세 가지 주요 기술의 조합을 통해 가속화를 달성합니다:
- Attention Acceleration: SageAttention과 Sparse-Linear Attention (SLA)을 사용하여 어텐션 메커니즘을 최적화합니다.
- Timestep Distillation: rCM을 사용하여 타임스텝 증류를 수행하여 필요한 샘플링 단계를 줄입니다.
- Quantization: 선형 레이어에 양자화된 체크포인트(checkpoints)를 제공하여 RTX 4090 및 5090과 같은 소비자용 GPU에서 효율적으로 실행할 수 있게 합니다.
Who it’s for
이 프로젝트는 비디오 생성 모델(특히 Wan 시리즈)을 다루는 개발자와 연구자들을 위한 것입니다. 이들은 몇 분 또는 몇 시간 대신 몇 초 만에 고품질 비디오(480p 또는 720p)를 생성해야 합니다.
Highlights
- Massive Speedup: RTX 5090에서 특정 모델의 생성 시간을 184s에서 1.9s로 단축합니다.
- SLA Support: SageSLA를 포함합니다. 이는 SageAttention을 기반으로 한 빠른 SLA 포워드 패스입니다.
- Flexible Modalities: Text-to-Video (T2V) 및 Image-to-Video (I2V) 생성을 모두 지원합니다.
- Hardware Optimized: 하이엔드 데이터 센터 GPU (H100) 및 소비자용 GPU (RTX 5090/4090)를 위한 특정 구성 및 체크포인트를 제공합니다.