dc-ai-projects/DC-Gen

DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space

해결하는 문제

DC-Gen은 현대의 시각적 확산 모델이 가지는 높은 계산 비용과 낮은 처리량 문제를 해결합니다. 이로 인해 고해상도(예: 4K) 이미지 및 동영상 생성이 트레이닝 및 추론 시간 측면에서 매우 비용이 많이 드는 경우가 많습니다.

작동 방식

DC-Gen은 사전 훈련된 확산 모델을 극도로 압축된 잠재 공간으로 이전하는 가속화 프레임워크입니다. 임베딩 정렬(Embedding Alignment) 기술을 사용하여 기존 모델의 지식을 새로운 잠재 공간으로 전이함으로써, 확산 모델의 가중치를 처음부터 재학습하지 않고도 의미적으로 올바른 시각 콘텐츠를 생성할 수 있도록 합니다. 이후 몇 단계의 엔드투엔드 미세조정 또는 LoRA 미세조정을 통해 완전한 품질을 복원합니다.

대상 사용자

확산 모델을 사용하는 개발자 및 연구자 중, 추론 속도를 크게 향상시키고, 원래 기반 모델의 막대한 부담 없이 고해상도 이미지 및 동영상을 생성할 수 있는 능력이 필요한 분들.

주요 특징

  • 엄청난 속도 향상: H100 GPU에서 FLUX.1-Krea와 같은 모델의 4K 해상도에서 최대 53.8배 빠른 추론을 달성.
  • 다양한 적용 가능성: 텍스트 → 이미지(1K 및 4K), 텍스트 → 동영상, 이미지 → 동영상, 지시 기반 이미지 편집을 모두 지원.
  • 효율적인 적응: 전체 모델 재학습 없이도 자동 인코더를 빠르게 적응시킬 수 있음.
  • 고품질 유지: 기반 모델의 사실성과 텍스트 렌더링 능력을 유지하면서 토큰의 중복성을 극도로 줄임.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트