SDXL과 Stable Diffusion을 위한 Latent Consistency LoRAs 기반 빠른 추론

Hugging Face는 Stable Diffusion과 SDXL 모델이 48 단계로 고품질 이미지를 생성할 수 있게 하는 Latent Consistency LoRAs(LCM LoRAs)를 도입했습니다. 일반적인 2550 단계에 비해 이 발전은 추론 시간을 크게 줄여 고급 GPU에서 거의 실시간 이미지 생성을 가능하게 하고 저사양 하드웨어에서의 접근성을 크게 향상시킵니다.

LCM LoRA 방법 개요

LCM LoRAs는 전체 모델을 별도로 증류하지 않고 Low-Rank Adaptation(LoRA)을 활용하여 잠재적 일관성 증류를 구현합니다. 비용이 많이 들고 데이터 집약적인 전체 모델 증류 과정 대신, 소수의 어댑터 레이어를 훈련시킵니다. 이러한 결과 LoRAs는 기본 모델의 어떤 파인튜닝 버전에도 적용할 수 있으며, 다양한 모델 버전에서 잠재적 일관성 증류의 이점을 제공합니다.

구현 과정은 세 가지 주요 단계로 구성됩니다:

  1. 교사 모델 선택 (예: SDXL 기본 모델 또는 파인튜닝된 버전).
  2. Parameter-Efficient Fine-Tuning(PEFT)를 사용하여 LCM LoRA 훈련.
  3. 어떤 SDXL 확산 모델과 LCMScheduler를 함께 사용하여 고품질, 저단계 추론에 LoRA를 적용합니다.

성능 벤치마크 및 하드웨어 영향

LCM LoRAs는 다양한 하드웨어 구성에서 이미지 생성 시간을 한 자릿수 규모로 줄입니다. 1024x1024 이미지에 대한 속도 향상은 다음과 같습니다:

하드웨어 SDXL LoRA LCM (4단계) SDXL 표준 (25단계)
Mac, M1 Max 6.5s 64s
2080 Ti 4.7s 10.2s
3090 1.4s 7s
4090 0.7s 3.4s
T4 (Google Colab Free) 8.4s 26.5s
A100 (80 GB) 1.2s 3.8s
Intel i9-10980XE CPU 29s 219s

NVIDIA RTX 4090에서는 응답 시간이 1초 미만으로, 실시간 상호작용이 필요한 애플리케이션에서 SDXL 사용을 가능하게 합니다. M1 Mac에서는 생성 시간이 약 1분에서 약 6초로 감소합니다.

품질, 가이던스, 및 모델 호환성

추론 품질 vs. 단계 수

1단계 생성은 텍스처 없이 대략적인 형태만 생성하지만, 4~6 단계 사이에서 품질이 빠르게 향상됩니다. 표준 SDXL 파이프라인과 비교하면, 약 20 단계까지는 사용 불가능한 이미지를 생성하는 경향이 있으며, 최고 수준의 디테일을 얻으려면 50 단계가 필요합니다.

가이던스 스케일 및 네거티브 프롬프트

최대 속도를 위해 guidance_scale 값 1을 사용하는 것이 권장되며, 이는 가이던스를 효과적으로 비활성화합니다. 네거티브 프롬프트를 사용하려면 guidance_scale 값을 1과 2 사이로 설정할 수 있지만, 2보다 큰 값은 일반적으로 효과가 없습니다.

파인튜닝된 모델과의 호환성

LCM LoRAs는 어떤 파인튜닝된 SDXL 또는 Stable Diffusion 모델과도 호환됩니다. 예를 들어, SD v1.5에 해당하는 LCM LoRA를 로드하여 collage-diffusion(Stable Diffusion v1.5의 Dreambooth 파인튜닝)에 이 기술을 적용하면 전문 스타일에 대한 4단계 추론이 가능해집니다.

통합 및 고급 워크플로

Diffusers 통합

LCM은 diffusers 라이브러리에 완전히 통합되어 다음과 같은 기능을 제공합니다:

  • Apple Silicon을 위한 네이티브 mps 지원.
  • torch.compile() 및 flash attention을 포함한 성능 최적화.
  • 저-RAM 환경을 위한 모델 오프로드와 같은 메모리 절약 전략.
  • ControlNet 및 이미지-이미지 워크플로 지원.

LoRA 결합

diffusers 및 PEFT 통합을 사용하여 사용자는 LCM LoRAs와 일반 SDXL LoRAs를 결합할 수 있습니다.これにより、CiroN2022/toy_face와 같은 전문 스타일 또는 주제 LoRAs는 여러 어댑터와 해당 가중치를 설정함으로써 LCM 프로세스의 4단계 추론 속도의 이점을 얻을 수 있습니다.

사용 가능한 모델 및 리소스

Hugging Face는 여러 LCM LoRAs와 전체 모델을 출시했습니다:

  • LCM LoRAs: SDXL 1.0 기본 모델, Stable Diffusion v1.5, 그리고 Segmind의 SSD-1B(증류된 SDXL 모델)에서 사용 가능.
  • 전체 모델: SDXL 1.0 기본 모델 및 SSD-1B에서 파생된 전체 파인튜닝된 일관성 모델.

Stable Diffusion 1.5와 SDXL 모두에 대해 diffusers 저장소 내에서 훈련 및 파인튜닝 스크립트가 이제 제공되어, 커뮤니티는 전체 모델 증류 또는 보다 접근하기 쉬운 LCM LoRA 훈련 중 하나를 수행할 수 있습니다.

Sources