ModelTC/LightX2V-Qwen-Image-Lightning

Qwen-Image-Lightning: Speed up Qwen-Image model with distillation

📌 Qwen‑Image‑Lightning이란?

Qwen‑Image‑Lightning은 QwenLM 팀이 출시한 Qwen‑Image 텍스트-이미지 모델을 위한 증류된(즉, 더 빠르고 가벼운) 체크포인트 파일 세트입니다. "Lightning" 모델은 이미지 내에 복잡한 중국어/영어 텍스트를 렌더링하는 원래의 능력을 유지하지만, 훨씬 적은 확산 단계(100단계 기준선 대신 4 또는 8단계)가 필요하여 약간의 품질 손실만으로 12–25배 속도 향상을 제공합니다.


🔧 주요 구성 요소

구성 요소 내용 일반적인 용도
Lightning 체크포인트 Qwen‑Image(베이스) 및 Qwen‑Image‑Edit(편집)용 증류된 가중치를 포함하는 .safetensors 파일(fp32, bf16, fp8). 🤗 Diffusers, ComfyUI 또는 Qwen‑Image를 지원하는 모든 파이프라인으로 로드.
LoRA 가중치 품질을 향상시키거나 FP8 베이스에 적응하기 위해 베이스 모델 위에 적용할 수 있는 저순위 어댑터("Lightning LoRAs"). 미세 조정 또는 더 나은 시각적 충실도를 위해 기존 LoRA와 결합.
ComfyUI 워크플로우 ComfyUI 비주얼 편집기에서 바로 실행할 수 있는 그래프를 설명하는 JSON 파일. ComfyUI 내에서 원클릭 생성 또는 편집.
평가 스크립트 캐시 가속 또는 4비트 양자화를 사용하여 모델을 실행하는 방법을 보여주는 예제 스크립트(예: Nunchaku 리포지토리). 속도/품질 벤치마크 또는 GPU 메모리 감소.

🚀 Lightning 버전을 사용하는 이유는?

  • 속도 – 4단계 모델은 원래 100단계 확산의 극히 일부 시간에 실행됩니다.
  • 메모리 친화적 – FP8 / 4비트 변형을 사용하면 단일 소비자용 GPU에서 실행할 수 있습니다.
  • 호환성 – 공식 🤗 Diffusers QwenImagePipeline, ComfyUI 및 Nunchaku 및 Cache‑dit와 같은 타사 도구와 함께 작동합니다.
  • 품질 중심 업데이트 – V2.0은 V1.x에 비해 과포화 및 피부 질감을 개선했습니다.

📂 시작하는 방법

  1. 체크포인트 선택 – 필요한 단계 수(4 또는 8)와 정밀도(fp32, bf16, fp8)를 선택합니다. 링크는 최신 뉴스 섹션에 있습니다.
  2. Diffusers로 로드
    from diffusers import QwenImagePipeline
    pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0")
    image = pipe(prompt="...", num_inference_steps=4).images[0]
    
  3. 선택적 LoRA – FP8 베이스를 사용하는 경우 일치하는 Lightning LoRA를 다운로드("FP8 모델과 함께 Lightning LoRA 사용" 표 참조)하고 pipe.unet.add_adapter()로 적용합니다.
  4. ComfyUI – 제공된 JSON 워크플로우(workflows/...json)를 열어 모델을 시각적으로 실행합니다.

📊 보고된 성능(README에서)

모델 단계 베이스 대비 속도 향상 일반적인 품질 참고 사항
Qwen‑Image‑Lightning‑8steps‑V1.1 8 약 12배 빠름 전반적으로 양호하지만 머리카락 같은 디테일이 약간 흐려질 수 있음.
Qwen‑Image‑Lightning‑4steps‑V1.0 4 약 25배 빠름 매우 빠름; 조밀한 장면에서 미세한 텍스트 렌더링이 손실될 수 있음.
V2.0(4단계 및 8단계 모두) 4 / 8 유사한 속도 과포화 감소, 더 나은 피부톤.

README는 또한 매우 조밀하거나 작은 텍스트의 경우 원래 100단계 모델이 여전히 가장 성능이 좋으며, 극도로 복잡한 장면은 모든 버전에 도전 과제가 될 수 있다고 언급합니다.


🛠️ 알려진 문제 및 수정 사항

  • BF16에서 학습된 LoRA와 함께 원래 FP8 베이스를 사용할 때 그리드 아티팩트 발생. 리포지토리는 두 가지 해결책을 제공합니다:
    1. FP8 베이스에서 학습된 새로 증류된 Lightning LoRA를 사용합니다.
    2. 기존 LoRA와 더 잘 정렬되는 스케일링된 FP8 베이스 가중치(qwen_image_fp8_e4m3fn_scaled.safetensors)로 전환합니다.
  • 공식 Qwen‑Image FP8 모델과의 호환성은 2025년 10월에 수정되었습니다(Issue #32 참조).

📚 더 알아보기

  • Diffusers 문서https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage
  • ComfyUI 튜토리얼https://docs.comfy.org/tutorials/image/qwen/qwen-image
  • Nunchaku 예제 스크립트https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py
  • Cache‑dit 3.5단계 추론https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py

🎯 TL;DR

Qwen‑Image‑Lightning은 Qwen‑Image 텍스트-이미지 모델을 위한 빠르고 저단계의 증류 체크포인트(4 / 8단계)를 제공하며, 여러 정밀도 형식과 바로 사용할 수 있는 LoRA 어댑터를 갖추고 있습니다. 주요 확산 툴킷(🤗 Diffusers, ComfyUI)과 통합되며 복잡한 중국어/영어 텍스트를 렌더링하는 뛰어난 능력을 유지하면서 원래 모델에서의 명확한 업그레이드 경로를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트