Qwen-Image-Edit 发布说明

Qwen-Image-Edit 是基于 20B Qwen-Image 基础构建的专用图像编辑模型。它通过同时利用 Qwen2.5-VL 进行视觉语义控制和 VAE Encoder 进行视觉外观控制,实现高质量的语义编辑、外观编辑以及精确的双语文本修改。

语义与外观编辑的双控制架构

Qwen-Image-Edit 采用双输入机制来处理两种不同的图像修改:语义编辑和外观编辑。

语义编辑

语义编辑在修改图像内容的同时保持原始的视觉语义和主体身份。这允许进行高层次的更改,整体像素可能会变化,但核心主体保持一致。主要能力包括:

  • IP 创建与一致性:模型能够生成包含一致角色(例如 Qwen 的水豚吉祥物)的多样化内容,适用于不同场景,如创建主题表情包。
  • 新视角合成:模型可以对对象进行 90 度或完整 180 度旋转,以展示对象的背面。
  • 风格迁移:人像可以被转换为各种艺术风格,例如《千与千寻》风格,用于虚拟头像创建等场景。

外观编辑

外观编辑侧重于低层次的视觉修改,特定区域会被改变,而图像的其他所有区域保持完全不变。主要能力包括:

  • 元素修改:添加或删除特定元素,例如插入带有相应倒影的招牌,或去除细小的发丝。
  • 精确颜色调整:修改特定小元素的颜色,例如单词中的单个字母。
  • 环境变化:调整背景或更换人物的服装。

精确的双语文本编辑

Qwen-Image-Edit 扩展了 Qwen-Image 的文本渲染能力,以支持精确的双语(中英)文本编辑。模型能够在图像中添加、删除或修改文本,同时保持原始的字体、大小和样式。此功能可用于纠正复杂的文本元素,包括大型标题以及中文海报中细小、精细的细节。

链式编辑工作流

Qwen-Image-Edit 支持链式、逐步的编辑方法来纠正复杂错误。用户可以在图像上绘制边框标记需要纠正的区域,迭代地细化输出。例如,在书法作品中,模型可用于逐个纠正特定字符错误,细调字符的模糊部件,直至最终结果准确。

性能与可用性

在多个公开基准上的评估表明,Qwen-Image-Edit 在图像编辑任务中达到了业界领先(SOTA)的性能。该模型可通过 Qwen Chat 的 “Image Editing” 功能使用,模型权重托管在 GitHub、Hugging Face 和 ModelScope。

Sources