ModelTC/LightX2V-Qwen-Image-Lightning

Qwen-Image-Lightning: Speed up Qwen-Image model with distillation

📌 什么是 Qwen‑Image‑Lightning

Qwen‑Image‑Lightning 是 QwenLM 团队发布的 Qwen‑Image 文本到图像模型的一组蒸馏(即更快速、更轻量)检查点文件。“Lightning”模型保留了原始模型在图像中渲染复杂中/英文文本的能力,但它们需要更少的扩散步数(4 或 8 步,而不是 100 步的基准),提供 12–25 倍的加速,且仅有轻微的质量损失。


🔧 主要组件

组件 内容 典型用途
Lightning 检查点 .safetensors 文件(fp32, bf16, fp8),包含 Qwen‑Image(基础版)和 Qwen‑Image‑Edit(编辑版)的蒸馏权重。 使用 🤗 Diffusers、ComfyUI 或任何支持 Qwen‑Image 的管线加载。
LoRA 权重 低秩适配器(“Lightning LoRAs”),可在基础模型之上应用,以提升质量或适应 FP8 基础模型。 微调或与现有的 LoRAs 结合以获得更好的视觉保真度。
ComfyUI 工作流 JSON 文件,描述在 ComfyUI 可视化编辑器中可直接运行的图表。 在 ComfyUI 中一键生成或编辑。
评估脚本 示例脚本(例如,在 Nunchaku 仓库中),展示如何使用缓存加速或 4 位量化来运行模型。 进行速度/质量基准测试或减少 GPU 显存使用。

🚀 为什么使用 Lightning 版本?

  • 速度 – 4 步模型的运行时间仅为原始 100 步扩散的一小部分。
  • 显存友好 – FP8 / 4 位变体让您能在单张消费级 GPU 上运行。
  • 兼容性 – 与官方 🤗 Diffusers QwenImagePipeline、ComfyUI 以及第三方工具(如 Nunchaku 和 Cache‑dit)配合使用。
  • 专注于质量的更新 – V2.0 改善了 V1.x 的过饱和与皮肤纹理问题。

📂 如何开始使用

  1. 选择检查点 – 选择您需要的步数(4 或 8)和精度(fp32, bf16, fp8)。链接位于最新消息部分。
  2. 使用 Diffusers 加载
    from diffusers import QwenImagePipeline
    pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0")
    image = pipe(prompt="...", num_inference_steps=4).images[0]
    
  3. 可选的 LoRA – 如果您使用 FP8 基础模型,请下载匹配的 Lightning LoRA(请参阅“将 Lightning LoRAs 与 FP8 模型搭配使用”表格),并使用 pipe.unet.add_adapter() 来应用它。
  4. ComfyUI – 打开提供的 JSON 工作流(workflows/...json)以可视化方式运行模型。

📊 报告的性能(来自 README)

模型 步数 相比基础版的加速 典型质量说明
Qwen‑Image‑Lightning‑8steps‑V1.1 8 快约 12 倍 整体不错,但毛发状细节可能会稍微模糊。
Qwen‑Image‑Lightning‑4steps‑V1.0 4 快约 25 倍 非常快;在密集场景中可能会丢失精细的文本渲染。
V2.0(4 步和 8 步) 4 / 8 速度相似 减少过饱和,更好的肤色。

README 还指出,对于非常密集或小型的文本,原始的 100 步模型仍然表现最好,而极度复杂的场景可能会对所有版本构成挑战。


🛠️ 已知问题与修复

  • 在使用原始 FP8 基础模型搭配在 BF16 上训练的 LoRAs 时出现网格伪影。该仓库提供了两种解决方案:
    1. 使用在 FP8 基础模型上训练的新蒸馏 Lightning LoRA。
    2. 切换到缩放后的 FP8 基础权重(qwen_image_fp8_e4m3fn_scaled.safetensors),它与现有的 LoRAs 对齐得更好。
  • 与官方 Qwen‑Image FP8 模型的兼容性问题已于 2025 年 10 月修复(请参阅 Issue #32)。

📚 哪里可以了解更多

  • Diffusers 文档https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage
  • ComfyUI 教程https://docs.comfy.org/tutorials/image/qwen/qwen-image
  • Nunchaku 示例脚本https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py
  • Cache‑dit 3.5 步推理https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py

🎯 TL;DR

Qwen‑Image‑Lightning 为 Qwen‑Image 文本到图像模型提供了快速、低步数的蒸馏检查点(4 / 8 步),具备多种精度格式和开箱即用的 LoRA 适配器。它与主要的扩散工具包(🤗 Diffusers, ComfyUI)集成,并提供了从原始模型升级的明确路径,同时保留了渲染复杂中/英文文本的出色能力。

相关

  • 项目
  • 项目
  • 项目
  • 项目