vipshop/cache-dit

A PyTorch-native inference engine with cache, parallelism, quantization and cpu offload for DiTs.

해결하는 문제

Cache-DiT는 Diffusion Transformers (DiTs)의 실행을 가속화하도록 설계된 PyTorch 네이티브 추론 엔진입니다. 이미지, 비디오 및 오디오 생성에 사용되는 대규모 DiT 모델의 높은 계산 비용과 메모리 요구 사항을 해결하여 더 빠른 추론 속도와 효율적인 하드웨어 활용을 가능하게 합니다.

작동 방식

Hugging Face Diffusers 라이브러리를 기반으로 구축된 Cache-DiT는 지연 시간과 메모리 사용량을 줄이기 위해 여러 최적화 기술을 채택합니다:

  • 하이브리드 캐시 가속: 중복 계산을 피하기 위해 다양한 캐싱 전략(DBCache, TaylorSeer, SCM, DMD 등)을 구현합니다.
  • 병렬 처리: 컨텍스트 병렬성(Context Parallelism), 텐서 병렬성(Tensor Parallelism) 및 하이브리드 2D/3D 병렬성을 포함한 광범위한 병렬 전략을 지원하며, Text Encoders, VAEs, ControlNets에 대한 전용 지원을 제공합니다.
  • 메모리 관리: 양자화(W8A8, W4A4) 및 버킷 스타일의 레이어별 CPU 오프로딩을 제공하여 GPU 메모리 사용을 최소화합니다.
  • 하드웨어 호환성: NVIDIA GPU, Ascend NPU, AMD GPU에서 네이티브로 실행되며 PyTorch 컴파일과 호환됩니다.

대상 사용자

이 엔진은 프로덕션 또는 고성능 컴퓨팅 환경을 위해 추론 파이프라인을 최적화해야 하는 DiT 기반 생성 AI 모델(FLUX, CogVideoX, HunyuanVideo 등)을 다루는 개발자와 연구자를 대상으로 합니다.

주요 특징

  • 폭넓은 모델 지원: Diffusers의 40개 이상의 DiT 파이프라인 제품군과 120개 이상의 변형을 지원합니다.
  • 엄청난 속도 향상: 캐싱, 컨텍스트 병렬성 및 컴파일의 조합을 통해 최대 9배의 속도 향상을 달성할 수 있습니다。
  • 심층 통합: SGLang Diffusion, vLLM-Omni, TensorRT-LLM, ComfyUI와 같은 인기 프레임워크와 완전히 통합됩니다。
  • 에이전트 통합: GitHub Copilot 또는 Claude Code와 같은 코딩 에이전트를 사용하여 사용자가 새로운 DiT 파이프라인을 통합할 수 있도록 돕는 모델 통합 SKILL을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch