ModelTC/LightX2V-Qwen-Image-Lightning
Qwen-Image-Lightning: Speed up Qwen-Image model with distillation
📌 什麼是 Qwen‑Image‑Lightning?
Qwen‑Image‑Lightning 是 QwenLM 團隊發布的 Qwen‑Image 文字轉圖像模型的一組蒸餾(即更快速、更輕量)檢查點檔案。「Lightning」模型保留了原始模型在圖像中渲染複雜中/英文文字的能力,但它們需要更少的擴散步驟(4 或 8 步,而不是 100 步的基準),提供 12–25 倍的加速,且僅有輕微的品質損失。
🔧 主要元件
| 元件 | 內容 | 典型用途 |
|---|---|---|
| Lightning 檢查點 | .safetensors 檔案(fp32, bf16, fp8),包含 Qwen‑Image(基礎版)和 Qwen‑Image‑Edit(編輯版)的蒸餾權重。 |
使用 🤗 Diffusers、ComfyUI 或任何支援 Qwen‑Image 的管線載入。 |
| LoRA 權重 | 低秩介面卡(「Lightning LoRAs」),可在基礎模型之上應用,以提升品質或適應 FP8 基礎模型。 | 微調或與現有的 LoRAs 結合以獲得更好的視覺保真度。 |
| ComfyUI 工作流程 | JSON 檔案,描述在 ComfyUI 視覺編輯器中可立即執行的圖表。 | 在 ComfyUI 中一鍵生成或編輯。 |
| 評估腳本 | 範例腳本(例如,在 Nunchaku 儲存庫中),展示如何使用快取加速或 4 位元量化來執行模型。 | 進行速度/品質基準測試或減少 GPU 記憶體使用。 |
🚀 為什麼使用 Lightning 版本?
- 速度 – 4 步模型運行時間僅為原始 100 步擴散的一小部分。
- 記憶體友善 – FP8 / 4 位元變體讓您能在單一消費級 GPU 上運行。
- 相容性 – 與官方 🤗 Diffusers
QwenImagePipeline、ComfyUI 以及第三方工具(如 Nunchaku 和 Cache‑dit)搭配使用。 - 專注於品質的更新 – V2.0 改善了 V1.x 的過度飽和與皮膚紋理問題。
📂 如何開始使用
- 選擇檢查點 – 選擇您需要的步數(4 或 8)和精度(fp32, bf16, fp8)。連結位於最新消息區塊。
- 使用 Diffusers 載入
from diffusers import QwenImagePipeline pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0") image = pipe(prompt="...", num_inference_steps=4).images[0] - 選用的 LoRA – 如果您使用 FP8 基礎模型,請下載對應的 Lightning LoRA(請參閱「將 Lightning LoRAs 與 FP8 模型搭配使用」表格),並使用
pipe.unet.add_adapter()來應用它。 - ComfyUI – 開啟提供的 JSON 工作流程(
workflows/...json)以視覺化方式運行模型。
📊 報告的效能(來自 README)
| 模型 | 步數 | 相比基礎版的加速 | 典型品質說明 |
|---|---|---|---|
| Qwen‑Image‑Lightning‑8steps‑V1.1 | 8 | 快約 12 倍 | 整體不錯,但毛髮狀細節可能會稍微模糊。 |
| Qwen‑Image‑Lightning‑4steps‑V1.0 | 4 | 快約 25 倍 | 非常快;在密集場景中可能會失去精細的文字渲染。 |
| V2.0(4 步和 8 步) | 4 / 8 | 速度相似 | 減少過度飽和,更好的膚色。 |
README 還指出,對於非常密集或小型的文字,原始的 100 步模型仍然表現最好,而極度複雜的場景可能會對所有版本構成挑戰。
🛠️ 已知問題與修復
- 在使用原始 FP8 基礎模型搭配在 BF16 上訓練的 LoRAs 時出現網格偽影。該儲存庫提供了兩種解決方案:
- 使用在 FP8 基礎模型上訓練的新蒸餾 Lightning LoRA。
- 切換到縮放後的 FP8 基礎權重(
qwen_image_fp8_e4m3fn_scaled.safetensors),它與現有的 LoRAs 對齊得更好。
- 與官方 Qwen‑Image FP8 模型的相容性問題已於 2025 年 10 月修復(請參閱 Issue #32)。
📚 哪裡可以了解更多
- Diffusers 文件 –
https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage - ComfyUI 教學 –
https://docs.comfy.org/tutorials/image/qwen/qwen-image - Nunchaku 範例腳本 –
https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py - Cache‑dit 3.5 步推論 –
https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py
🎯 TL;DR
Qwen‑Image‑Lightning 為 Qwen‑Image 文字轉圖像模型提供了快速、低步數的蒸餾檢查點(4 / 8 步),具備多種精度格式和開箱即用的 LoRA 介面卡。它與主要的擴散工具包(🤗 Diffusers, ComfyUI)整合,並提供了從原始模型升級的明確路徑,同時保留了渲染複雜中/英文文字的出色能力。
相關
- 專案
- 專案
- 專案
- 專案