thu-ml/TurboDiffusion

TurboDiffusion: 100–200× Acceleration for Video Diffusion Models

해결하는 문제

TurboDiffusion은 비디오 확산 모델의 높은 계산 비용과 느린 생성 속도 문제를 해결합니다. 원래의 비디오 품질을 유지하면서 단일 RTX 5090에서 엔드투엔드 생성 지연 시간을 100배에서 200배까지 크게 단축합니다.

작동 원리

이 프레임워크는 세 가지 주요 기술의 조합을 통해 가속을 달성합니다:

  • Attention Acceleration: SageAttention과 Sparse-Linear Attention (SLA)를 사용하여 어텐션 메커니즘을 가속화합니다.
  • Timestep Distillation: rCM을 사용하여 타임스텝 증류를 수행함으로써 필요한 샘플링 단계 수를 줄입니다.
  • Quantization: 선형 레이어에 대해 양자화된 체크포인트를 제공하여 RTX 4090 및 5090과 같은 소비자용 GPU에서 고성능 생성을 가능하게 합니다.

대상

단일 GPU에서 거의 즉각적인 추론 속도가 필요한 비디오 생성 모델(특히 Wan 시리즈)을 다루는 개발자와 연구자를 위해 설계되었습니다.

주요 특징

  • 대규모 속도 향상: RTX 5090에서 특정 모델의 생성 시간을 184초에서 1.9초로 단축합니다.
  • 다양한 지원: Text-to-Video (T2V) 및 Image-to-Video (I2V) 워크플로우를 모두 지원합니다。
  • 유연한 해상도: 480p 및 720p 해상도로 비디오를 생성할 수 있습니다。
  • 멀티 GPU 호환성: 다양한 하드웨어(예: RTX 시리즈 vs H100)에 맞게 양자화된 체크포인트와 양자화되지 않은 체크포인트를 모두 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트