Qwen-Image-2.1 发布说明 / 新功能介绍

Qwen-Image-2.1 将图像生成与编辑统一到一个 7B 参数模型中

Qwen-Image-2.1 是一个开源图像模型,将文本到图像生成与图像编辑整合到单一架构中。它包含一个具有 7B 参数和 32 个 Single-Stream DiT 层的视觉生成组件,在保持高生成质量的同时,兼顾推理效率并降低计算成本。

原生透明度与统一创作

Qwen-Image-2.1 原生支持生成和编辑透明图像(RGBA),统一了此前在专用模型(如 Qwen-Image-Layered)中才有的功能。

  • 文本到透明度: 模型通过提示词决定输出标准 RGB 图像还是带有透明通道的图像。
  • 透明层编辑: 用户可以在透明层中编辑元素——例如更改主体的表情或修改文字(如将 "BLOOM" 替换为 "Qwen-Image")——同时保持透明背景。
  • 主体提取: 模型可处理一张 RGB 照片,并提取特定主体为带有透明度的 RGBA 层,用于设计与构图。

高级图像编辑功能

Qwen-Image-2.1 引入了多项图像编辑增强功能,重点聚焦于参考能力、局部控制和保真度。

多参考图像

该模型支持最多 10 张参考图像,允许将多个不同资产组合成一个连贯的整体。示例包括:

  • 团体肖像: 将六张个人肖像合并为一张团体照片。
  • 虚拟试穿: 将五张输入(模特、服装、鞋子、包、帽子)合并为一套完整穿搭。
  • 室内设计: 使用 10 张家具图像生成完整的房间布局。

局部编辑与区域选择

Qwen-Image-2.1 提供三种指定编辑区域的方法:

  1. 圆形标记: 使用不同颜色的圆形标识多个区域,实现同时编辑(例如移除手表、改变发色、更换服装)。
  2. 涂绘注释: 用白色标记特定区域以添加新元素,例如在图像特定部分添加一名潜水员。
  3. 独立掩码: 接受原始图像和独立掩码作为两个独立输入,以保留原始内容的同时仅编辑掩码区域。

还可通过连续局部编辑创建简单动画,每次修改保留场景其余部分不变。

保真度与任务覆盖范围

该模型提升了肖像的人像特征保留能力(面部特征)和产品的一致性(文字、纹理和形状)。同时扩展了任务覆盖范围,包括:

  • 全景图: 从一张自拍生成全景图。
  • 信息图: 将模型照片扩展为详细构图。
  • 分镜脚本: 将三视图角色参考转化为完整分镜脚本。

推理效率与架构

为优化推理性能,尤其是在使用多张参考图像时,Qwen-Image-2.1 采用混合粒度注意力架构。

  • 注意力掩码: 文本、系统前缀和编辑指令使用基于 token 的因果掩码,而图像生成使用基于块的掩码。
  • KV 缓存复用: 输入图像和编辑指令被视为静态上下文,在第一步中计算并缓存,以减少内存占用并提升速度。

视觉美学与排版

Qwen-Image-2.1 具有更精细的美学表现,尤其注重排版与人像。文本渲染现在考虑字体样式、布局以及文本与整体构图的关系。人像生成通过增强光照效果和细节表现,进一步提升真实感。

Sources