ModelTC/LightX2V-Qwen-Image-Lightning
Qwen-Image-Lightning: Speed up Qwen-Image model with distillation
📌 什么是 Qwen‑Image‑Lightning?
Qwen‑Image‑Lightning 是 QwenLM 团队发布的 Qwen‑Image 文本到图像模型的一组蒸馏(即更快速、更轻量)检查点文件。“Lightning”模型保留了原始模型在图像中渲染复杂中/英文文本的能力,但它们需要更少的扩散步数(4 或 8 步,而不是 100 步的基准),提供 12–25 倍的加速,且仅有轻微的质量损失。
🔧 主要组件
| 组件 | 内容 | 典型用途 |
|---|---|---|
| Lightning 检查点 | .safetensors 文件(fp32, bf16, fp8),包含 Qwen‑Image(基础版)和 Qwen‑Image‑Edit(编辑版)的蒸馏权重。 |
使用 🤗 Diffusers、ComfyUI 或任何支持 Qwen‑Image 的管线加载。 |
| LoRA 权重 | 低秩适配器(“Lightning LoRAs”),可在基础模型之上应用,以提升质量或适应 FP8 基础模型。 | 微调或与现有的 LoRAs 结合以获得更好的视觉保真度。 |
| ComfyUI 工作流 | JSON 文件,描述在 ComfyUI 可视化编辑器中可直接运行的图表。 | 在 ComfyUI 中一键生成或编辑。 |
| 评估脚本 | 示例脚本(例如,在 Nunchaku 仓库中),展示如何使用缓存加速或 4 位量化来运行模型。 | 进行速度/质量基准测试或减少 GPU 显存使用。 |
🚀 为什么使用 Lightning 版本?
- 速度 – 4 步模型的运行时间仅为原始 100 步扩散的一小部分。
- 显存友好 – FP8 / 4 位变体让您能在单张消费级 GPU 上运行。
- 兼容性 – 与官方 🤗 Diffusers
QwenImagePipeline、ComfyUI 以及第三方工具(如 Nunchaku 和 Cache‑dit)配合使用。 - 专注于质量的更新 – V2.0 改善了 V1.x 的过饱和与皮肤纹理问题。
📂 如何开始使用
- 选择检查点 – 选择您需要的步数(4 或 8)和精度(fp32, bf16, fp8)。链接位于最新消息部分。
- 使用 Diffusers 加载
from diffusers import QwenImagePipeline pipe = QwenImagePipeline.from_pretrained("lightx2v/Qwen-Image-Lightning-4steps-V2.0") image = pipe(prompt="...", num_inference_steps=4).images[0] - 可选的 LoRA – 如果您使用 FP8 基础模型,请下载匹配的 Lightning LoRA(请参阅“将 Lightning LoRAs 与 FP8 模型搭配使用”表格),并使用
pipe.unet.add_adapter()来应用它。 - ComfyUI – 打开提供的 JSON 工作流(
workflows/...json)以可视化方式运行模型。
📊 报告的性能(来自 README)
| 模型 | 步数 | 相比基础版的加速 | 典型质量说明 |
|---|---|---|---|
| Qwen‑Image‑Lightning‑8steps‑V1.1 | 8 | 快约 12 倍 | 整体不错,但毛发状细节可能会稍微模糊。 |
| Qwen‑Image‑Lightning‑4steps‑V1.0 | 4 | 快约 25 倍 | 非常快;在密集场景中可能会丢失精细的文本渲染。 |
| V2.0(4 步和 8 步) | 4 / 8 | 速度相似 | 减少过饱和,更好的肤色。 |
README 还指出,对于非常密集或小型的文本,原始的 100 步模型仍然表现最好,而极度复杂的场景可能会对所有版本构成挑战。
🛠️ 已知问题与修复
- 在使用原始 FP8 基础模型搭配在 BF16 上训练的 LoRAs 时出现网格伪影。该仓库提供了两种解决方案:
- 使用在 FP8 基础模型上训练的新蒸馏 Lightning LoRA。
- 切换到缩放后的 FP8 基础权重(
qwen_image_fp8_e4m3fn_scaled.safetensors),它与现有的 LoRAs 对齐得更好。
- 与官方 Qwen‑Image FP8 模型的兼容性问题已于 2025 年 10 月修复(请参阅 Issue #32)。
📚 哪里可以了解更多
- Diffusers 文档 –
https://huggingface.co/docs/diffusers/main/api/pipelines/qwenimage - ComfyUI 教程 –
https://docs.comfy.org/tutorials/image/qwen/qwen-image - Nunchaku 示例脚本 –
https://github.com/nunchaku-tech/nunchaku/blob/main/examples/v1/qwen-image-lightning.py - Cache‑dit 3.5 步推理 –
https://github.com/vipshop/cache-dit/blob/main/examples/pipeline/run_qwen_image_lightning.py
🎯 TL;DR
Qwen‑Image‑Lightning 为 Qwen‑Image 文本到图像模型提供了快速、低步数的蒸馏检查点(4 / 8 步),具备多种精度格式和开箱即用的 LoRA 适配器。它与主要的扩散工具包(🤗 Diffusers, ComfyUI)集成,并提供了从原始模型升级的明确路径,同时保留了渲染复杂中/英文文本的出色能力。
相关
- 项目
- 项目
- 项目
- 项目