SDXL과 Stable Diffusion을 위한 Latent Consistency LoRAs 기반 빠른 추론
Hugging Face는 Stable Diffusion과 SDXL 모델이 48 단계로 고품질 이미지를 생성할 수 있게 하는 Latent Consistency LoRAs(LCM LoRAs)를 도입했습니다. 일반적인 2550 단계에 비해 이 발전은 추론 시간을 크게 줄여 고급 GPU에서 거의 실시간 이미지 생성을 가능하게 하고 저사양 하드웨어에서의 접근성을 크게 향상시킵니다.
LCM LoRA 방법 개요
LCM LoRAs는 전체 모델을 별도로 증류하지 않고 Low-Rank Adaptation(LoRA)을 활용하여 잠재적 일관성 증류를 구현합니다. 비용이 많이 들고 데이터 집약적인 전체 모델 증류 과정 대신, 소수의 어댑터 레이어를 훈련시킵니다. 이러한 결과 LoRAs는 기본 모델의 어떤 파인튜닝 버전에도 적용할 수 있으며, 다양한 모델 버전에서 잠재적 일관성 증류의 이점을 제공합니다.
구현 과정은 세 가지 주요 단계로 구성됩니다:
- 교사 모델 선택 (예: SDXL 기본 모델 또는 파인튜닝된 버전).
- Parameter-Efficient Fine-Tuning(PEFT)를 사용하여 LCM LoRA 훈련.
- 어떤 SDXL 확산 모델과
LCMScheduler를 함께 사용하여 고품질, 저단계 추론에 LoRA를 적용합니다.
성능 벤치마크 및 하드웨어 영향
LCM LoRAs는 다양한 하드웨어 구성에서 이미지 생성 시간을 한 자릿수 규모로 줄입니다. 1024x1024 이미지에 대한 속도 향상은 다음과 같습니다:
| 하드웨어 | SDXL LoRA LCM (4단계) | SDXL 표준 (25단계) |
|---|---|---|
| Mac, M1 Max | 6.5s | 64s |
| 2080 Ti | 4.7s | 10.2s |
| 3090 | 1.4s | 7s |
| 4090 | 0.7s | 3.4s |
| T4 (Google Colab Free) | 8.4s | 26.5s |
| A100 (80 GB) | 1.2s | 3.8s |
| Intel i9-10980XE CPU | 29s | 219s |
NVIDIA RTX 4090에서는 응답 시간이 1초 미만으로, 실시간 상호작용이 필요한 애플리케이션에서 SDXL 사용을 가능하게 합니다. M1 Mac에서는 생성 시간이 약 1분에서 약 6초로 감소합니다.
품질, 가이던스, 및 모델 호환성
추론 품질 vs. 단계 수
1단계 생성은 텍스처 없이 대략적인 형태만 생성하지만, 4~6 단계 사이에서 품질이 빠르게 향상됩니다. 표준 SDXL 파이프라인과 비교하면, 약 20 단계까지는 사용 불가능한 이미지를 생성하는 경향이 있으며, 최고 수준의 디테일을 얻으려면 50 단계가 필요합니다.
가이던스 스케일 및 네거티브 프롬프트
최대 속도를 위해 guidance_scale 값 1을 사용하는 것이 권장되며, 이는 가이던스를 효과적으로 비활성화합니다. 네거티브 프롬프트를 사용하려면 guidance_scale 값을 1과 2 사이로 설정할 수 있지만, 2보다 큰 값은 일반적으로 효과가 없습니다.
파인튜닝된 모델과의 호환성
LCM LoRAs는 어떤 파인튜닝된 SDXL 또는 Stable Diffusion 모델과도 호환됩니다. 예를 들어, SD v1.5에 해당하는 LCM LoRA를 로드하여 collage-diffusion(Stable Diffusion v1.5의 Dreambooth 파인튜닝)에 이 기술을 적용하면 전문 스타일에 대한 4단계 추론이 가능해집니다.
통합 및 고급 워크플로
Diffusers 통합
LCM은 diffusers 라이브러리에 완전히 통합되어 다음과 같은 기능을 제공합니다:
- Apple Silicon을 위한 네이티브
mps지원. torch.compile()및 flash attention을 포함한 성능 최적화.- 저-RAM 환경을 위한 모델 오프로드와 같은 메모리 절약 전략.
- ControlNet 및 이미지-이미지 워크플로 지원.
LoRA 결합
diffusers 및 PEFT 통합을 사용하여 사용자는 LCM LoRAs와 일반 SDXL LoRAs를 결합할 수 있습니다.これにより、CiroN2022/toy_face와 같은 전문 스타일 또는 주제 LoRAs는 여러 어댑터와 해당 가중치를 설정함으로써 LCM 프로세스의 4단계 추론 속도의 이점을 얻을 수 있습니다.
사용 가능한 모델 및 리소스
Hugging Face는 여러 LCM LoRAs와 전체 모델을 출시했습니다:
- LCM LoRAs: SDXL 1.0 기본 모델, Stable Diffusion v1.5, 그리고 Segmind의 SSD-1B(증류된 SDXL 모델)에서 사용 가능.
- 전체 모델: SDXL 1.0 기본 모델 및 SSD-1B에서 파생된 전체 파인튜닝된 일관성 모델.
Stable Diffusion 1.5와 SDXL 모두에 대해 diffusers 저장소 내에서 훈련 및 파인튜닝 스크립트가 이제 제공되어, 커뮤니티는 전체 모델 증류 또는 보다 접근하기 쉬운 LCM LoRA 훈련 중 하나를 수행할 수 있습니다.