ModelTC/LightX2V-Qwen-Image-Lightning
Qwen-Image-Lightning: Speed up Qwen-Image model with distillation
📌 Qwen‑Image‑Lightning이란?
Qwen‑Image‑Lightning은 QwenLM 팀이 출시한 Qwen‑Image 텍스트-이미지 모델을 위한 증류된(즉, 더 빠르고 가벼운) 체크포인트 파일 세트입니다. "Lightning" 모델은 이미지 내에 복잡한 중국어/영어 텍스트를 렌더링하는 원래의 능력을 유지하지만, 훨씬 적은 확산 단계(100단계 기준선 대신 4 또는 8단계)가 필요하여 약간의 품질 손실만으로 12–25배 속도 향상을 제공합니다.
🔧 주요 구성 요소
| 구성 요소 | 내용 | 일반적인 용도 |
|---|---|---|
| Lightning 체크포인트 | Qwen‑Image(베이스) 및 Qwen‑Image‑Edit(편집)용 증류된 가중치를 포함하는 .safetensors 파일(fp32, bf16, fp8). |
🤗 Diffusers, ComfyUI 또는 Qwen‑Image를 지원하는 모든 파이프라인으로 로드. |
| LoRA 가중치 | 품질을 향상시키거나 FP8 베이스에 적응하기 위해 베이스 모델 위에 적용할 수 있는 저순위 어댑터("Lightning LoRAs"). | 미세 조정 또는 더 나은 시각적 충실도를 위해 기존 LoRA와 결합. |
| ComfyUI 워크플로우 | ComfyUI 비주얼 편집기에서 바로 실행할 수 있는 그래프를 설명하는 JSON 파일. | ComfyUI 내에서 원클릭 생성 또는 편집. |
| 평가 스크립트 | 캐시 가속 또는 4비트 양자화를 사용하여 모델을 실행하는 방법을 보여주는 예제 스크립트(예: Nunchaku 리포지토리). | 속도/품질 벤치마크 또는 GPU 메모리 감소. |
🚀 Lightning 버전을 사용하는 이유는?
- 속도 – 4단계 모델은 원래 100단계 확산의 극히 일부 시간에 실행됩니다.
- 메모리 친화적 – FP8 / 4비트 변형을 사용하면 단일 소비자용 GPU에서 실행할 수 있습니다.
- 호환성 – 공식 🤗 Diffusers
QwenImagePipeline, ComfyUI 및 Nunchaku 및 Cache‑dit와 같은 타사 도구와 함께 작동합니다. - 품질 중심 업데이트 – V2.0은 V1.x에 비해 과포화 및 피부 질감을 개선했습니다.
📂 시작하는 방법
- 체크포인트 선택 – 필요한 단계 수(4 또는 8)와 정밀도(fp32, bf16, fp8)를 선택합니다. 링크는 최신 뉴스 섹션에 있습니다.
- Diffusers로 로드
from diffusers import QwenImagePipeline pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0") image = pipe(prompt="...", num_inference_steps=4).images[0] - 선택적 LoRA – FP8 베이스를 사용하는 경우 일치하는 Lightning LoRA를 다운로드("FP8 모델과 함께 Lightning LoRA 사용" 표 참조)하고
pipe.unet.add_adapter()로 적용합니다. - ComfyUI – 제공된 JSON 워크플로우(
workflows/...json)를 열어 모델을 시각적으로 실행합니다.
📊 보고된 성능(README에서)
| 모델 | 단계 | 베이스 대비 속도 향상 | 일반적인 품질 참고 사항 |
|---|---|---|---|
| Qwen‑Image‑Lightning‑8steps‑V1.1 | 8 | 약 12배 빠름 | 전반적으로 양호하지만 머리카락 같은 디테일이 약간 흐려질 수 있음. |
| Qwen‑Image‑Lightning‑4steps‑V1.0 | 4 | 약 25배 빠름 | 매우 빠름; 조밀한 장면에서 미세한 텍스트 렌더링이 손실될 수 있음. |
| V2.0(4단계 및 8단계 모두) | 4 / 8 | 유사한 속도 | 과포화 감소, 더 나은 피부톤. |
README는 또한 매우 조밀하거나 작은 텍스트의 경우 원래 100단계 모델이 여전히 가장 성능이 좋으며, 극도로 복잡한 장면은 모든 버전에 도전 과제가 될 수 있다고 언급합니다.
🛠️ 알려진 문제 및 수정 사항
- BF16에서 학습된 LoRA와 함께 원래 FP8 베이스를 사용할 때 그리드 아티팩트 발생. 리포지토리는 두 가지 해결책을 제공합니다:
- FP8 베이스에서 학습된 새로 증류된 Lightning LoRA를 사용합니다.
- 기존 LoRA와 더 잘 정렬되는 스케일링된 FP8 베이스 가중치(
qwen_image_fp8_e4m3fn_scaled.safetensors)로 전환합니다.
- 공식 Qwen‑Image FP8 모델과의 호환성은 2025년 10월에 수정되었습니다(Issue #32 참조).
📚 더 알아보기
- Diffusers 문서 –
https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage - ComfyUI 튜토리얼 –
https://docs.comfy.org/tutorials/image/qwen/qwen-image - Nunchaku 예제 스크립트 –
https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py - Cache‑dit 3.5단계 추론 –
https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py
🎯 TL;DR
Qwen‑Image‑Lightning은 Qwen‑Image 텍스트-이미지 모델을 위한 빠르고 저단계의 증류 체크포인트(4 / 8단계)를 제공하며, 여러 정밀도 형식과 바로 사용할 수 있는 LoRA 어댑터를 갖추고 있습니다. 주요 확산 툴킷(🤗 Diffusers, ComfyUI)과 통합되며 복잡한 중국어/영어 텍스트를 렌더링하는 뛰어난 능력을 유지하면서 원래 모델에서의 명확한 업그레이드 경로를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트