ModelTC/LightX2V-Qwen-Image-Lightning

Qwen-Image-Lightning: Speed up Qwen-Image model with distillation

📌 什麼是 Qwen‑Image‑Lightning

Qwen‑Image‑Lightning 是 QwenLM 團隊發布的 Qwen‑Image 文字轉圖像模型的一組蒸餾(即更快速、更輕量)檢查點檔案。「Lightning」模型保留了原始模型在圖像中渲染複雜中/英文文字的能力,但它們需要更少的擴散步驟(4 或 8 步,而不是 100 步的基準),提供 12–25 倍的加速,且僅有輕微的品質損失。


🔧 主要元件

元件 內容 典型用途
Lightning 檢查點 .safetensors 檔案(fp32, bf16, fp8),包含 Qwen‑Image(基礎版)和 Qwen‑Image‑Edit(編輯版)的蒸餾權重。 使用 🤗 Diffusers、ComfyUI 或任何支援 Qwen‑Image 的管線載入。
LoRA 權重 低秩介面卡(「Lightning LoRAs」),可在基礎模型之上應用,以提升品質或適應 FP8 基礎模型。 微調或與現有的 LoRAs 結合以獲得更好的視覺保真度。
ComfyUI 工作流程 JSON 檔案,描述在 ComfyUI 視覺編輯器中可立即執行的圖表。 在 ComfyUI 中一鍵生成或編輯。
評估腳本 範例腳本(例如,在 Nunchaku 儲存庫中),展示如何使用快取加速或 4 位元量化來執行模型。 進行速度/品質基準測試或減少 GPU 記憶體使用。

🚀 為什麼使用 Lightning 版本?

  • 速度 – 4 步模型運行時間僅為原始 100 步擴散的一小部分。
  • 記憶體友善 – FP8 / 4 位元變體讓您能在單一消費級 GPU 上運行。
  • 相容性 – 與官方 🤗 Diffusers QwenImagePipeline、ComfyUI 以及第三方工具(如 Nunchaku 和 Cache‑dit)搭配使用。
  • 專注於品質的更新 – V2.0 改善了 V1.x 的過度飽和與皮膚紋理問題。

📂 如何開始使用

  1. 選擇檢查點 – 選擇您需要的步數(4 或 8)和精度(fp32, bf16, fp8)。連結位於最新消息區塊。
  2. 使用 Diffusers 載入
    from diffusers import QwenImagePipeline
    pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0")
    image = pipe(prompt="...", num_inference_steps=4).images[0]
    
  3. 選用的 LoRA – 如果您使用 FP8 基礎模型,請下載對應的 Lightning LoRA(請參閱「將 Lightning LoRAs 與 FP8 模型搭配使用」表格),並使用 pipe.unet.add_adapter() 來應用它。
  4. ComfyUI – 開啟提供的 JSON 工作流程(workflows/...json)以視覺化方式運行模型。

📊 報告的效能(來自 README)

模型 步數 相比基礎版的加速 典型品質說明
Qwen‑Image‑Lightning‑8steps‑V1.1 8 快約 12 倍 整體不錯,但毛髮狀細節可能會稍微模糊。
Qwen‑Image‑Lightning‑4steps‑V1.0 4 快約 25 倍 非常快;在密集場景中可能會失去精細的文字渲染。
V2.0(4 步和 8 步) 4 / 8 速度相似 減少過度飽和,更好的膚色。

README 還指出,對於非常密集或小型的文字,原始的 100 步模型仍然表現最好,而極度複雜的場景可能會對所有版本構成挑戰。


🛠️ 已知問題與修復

  • 在使用原始 FP8 基礎模型搭配在 BF16 上訓練的 LoRAs 時出現網格偽影。該儲存庫提供了兩種解決方案:
    1. 使用在 FP8 基礎模型上訓練的新蒸餾 Lightning LoRA。
    2. 切換到縮放後的 FP8 基礎權重(qwen_image_fp8_e4m3fn_scaled.safetensors),它與現有的 LoRAs 對齊得更好。
  • 與官方 Qwen‑Image FP8 模型的相容性問題已於 2025 年 10 月修復(請參閱 Issue #32)。

📚 哪裡可以了解更多

  • Diffusers 文件https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage
  • ComfyUI 教學https://docs.comfy.org/tutorials/image/qwen/qwen-image
  • Nunchaku 範例腳本https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py
  • Cache‑dit 3.5 步推論https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py

🎯 TL;DR

Qwen‑Image‑Lightning 為 Qwen‑Image 文字轉圖像模型提供了快速、低步數的蒸餾檢查點(4 / 8 步),具備多種精度格式和開箱即用的 LoRA 介面卡。它與主要的擴散工具包(🤗 Diffusers, ComfyUI)整合,並提供了從原始模型升級的明確路徑,同時保留了渲染複雜中/英文文字的出色能力。

相關

  • 專案
  • 專案
  • 專案
  • 專案