Qwen-Image-2.1 发布:具备原生透明度支持的 7B 统一文生图与编辑模型

TL;DR

Qwen-Image-2.1 是一个紧凑的 7 B 视觉生成模型,可在单一模型中支持文生图生成和图像编辑——包括原生 RGBA 透明度,并且在 RTX 4090 上运行效率足够高,约五秒即可生成 1 MP 图像。


紧凑的架构与推理优化

结论: 模型轻量级设计(32 个 Single-Stream DiT 层,7 B 参数)在计算成本较低的情况下实现了具有竞争力的图像质量。

  • 视觉生成组件包含 32 个 DiT 层,总计 7 B 参数,显著小于 20 B 的 Qwen-Image-1,与 6 B 的 Z-Image Turbo 相当。
  • 采用混合粒度注意力机制,将文本的 token 级因果掩码与图像生成的 chunk 级掩码分离。这实现了 KV 缓存复用:输入图像和编辑指令仅需计算一次并缓存,从而在多图编辑过程中降低延迟和内存占用。
  • 在 Qwen-Image-Bench 上的基准测试显示,Qwen-Image-2.1 在图像质量上达到或超越许多闭源替代方案,同时运行成本远低于它们。

原生透明度与统一生成/编辑能力

结论: 透明度现已直接集成到模型中,无需额外的背景移除流程。

  • 模型根据提示决定输出 RGB 图像还是带有透明通道的 RGBA 图像。
  • 可生成简单的透明资产(图标、logo)以及包含多个元素的复杂构图。
  • 编辑可在透明图层上进行:表达、颜色甚至嵌入的文本均可修改,同时保留 alpha 通道。
  • 模型可从普通 RGB 照片中提取主体,并输出为干净的 RGBA 图层,为设计师简化资产复用流程。

多样化的编辑能力

多参考图像

结论: 最多可将十个参考图像合并为一个连贯的输出,支持复杂场景构图。

  • 示例:六张人物肖像参考合并为一张群像照片。
  • 示例:五件时尚单品(模特、服装、鞋子、包、帽子)组合成一套完整穿搭。
  • 示例:十张家具图像用于生成一个完整布置的室内场景。

灵活的区域选择

结论: 用户可通过圆形、涂鸦标注或独立掩码指定编辑区域,实现精细控制。

  • 圆形引导编辑可同时修改多个区域(例如移除手表、重新着色头发、更换服装)。
  • 涂鸦引导编辑允许用户绘制任意形状,指示新内容应出现的位置。
  • 掩码引导编辑可保留原始图像,模型填充掩码区域,支持简单动画的顺序编辑。

保真度提升

结论: 模型在人像中更好地保留身份特征,并保持产品细节(如文字、纹理、形状)的稳定性。

  • 人像示例显示编辑过程中面部特征保持一致。
  • 产品示例表明,logo、字体和材质纹理在操作后依然稳定。

扩展的任务覆盖范围

结论: Qwen-Image-2.1 可处理全景图、信息图和分镜脚本,展现出超越单图生成的适应性。

  • 自拍可扩展为全宽全景图。
  • 模特照片可转化为详细信息图。
  • 三视图角色草图可转换为多面板分镜脚本。

视觉质量:纹理、排版与人像光照

结论: 与之前开源版本相比,该模型在文本渲染和人像光照方面表现更清晰、更真实。

  • 文本渲染尊重字体样式、布局以及与周围图形的融合,生成可读性强的小文字元素。
  • 人像表现出更优的光照效果、更精细的面部细节和自然的阴影。

社区反馈亮点

  • 正面评价: 用户称赞其在网页设计任务中的文本渲染表现,并指出模型速度极快(在 RTX 4090 上生成 1 MP 图像约需 5 秒)。原生透明度功能被视为开源模型中的独特优势。
  • 负面反馈: 许多用户指出许可证比早期 Qwen 发布版本更严格,明确禁止未经单独协议的商业用途。部分评论者报告偶尔出现提示遵循问题和残留的 VAE 艺术品。
  • 观察意见: 多位评论者认为,该模型在成本效益方面优于闭源竞争对手,但也有观点指出开源社区可能最终绕过许可证限制。

实用注意事项

  • 安装: 模型可在 GitHub、Hugging Face 和 ModelScope 上获取。用户可通过提供的 convrot 推理脚本快速生成图像。
  • 硬件要求: 现代 GPU(如 RTX 4090)可在约 5 秒内生成 1 MP 图像;低端 GPU 的延迟将成比例增加。
  • 许可证: Qwen RESEARCH LICENSE 限制商业使用。部署至生产环境前,请务必查阅 GitHub 仓库中的许可证文件。

总结

Qwen-Image-2.1 证明了一个 7 B 的扩散模型可以在保持快速且低成本的同时,实现高质量、支持透明度的图像生成和复杂的多图编辑。其统一方法简化了设计师、电商创作者和视觉叙事者的工作流程,尽管受限的许可证可能影响其商业采用。

Sources

相关