Qwen-Image-2.1 发布说明 / 新功能介绍
Qwen-Image-2.1 将图像生成与编辑统一到一个 7B 参数模型中
Qwen-Image-2.1 是一个开源图像模型,将文本到图像生成与图像编辑整合到单一架构中。它包含一个具有 7B 参数和 32 个 Single-Stream DiT 层的视觉生成组件,在保持高生成质量的同时,兼顾推理效率并降低计算成本。
原生透明度与统一创作
Qwen-Image-2.1 原生支持生成和编辑透明图像(RGBA),统一了此前在专用模型(如 Qwen-Image-Layered)中才有的功能。
- 文本到透明度: 模型通过提示词决定输出标准 RGB 图像还是带有透明通道的图像。
- 透明层编辑: 用户可以在透明层中编辑元素——例如更改主体的表情或修改文字(如将 "BLOOM" 替换为 "Qwen-Image")——同时保持透明背景。
- 主体提取: 模型可处理一张 RGB 照片,并提取特定主体为带有透明度的 RGBA 层,用于设计与构图。
高级图像编辑功能
Qwen-Image-2.1 引入了多项图像编辑增强功能,重点聚焦于参考能力、局部控制和保真度。
多参考图像
该模型支持最多 10 张参考图像,允许将多个不同资产组合成一个连贯的整体。示例包括:
- 团体肖像: 将六张个人肖像合并为一张团体照片。
- 虚拟试穿: 将五张输入(模特、服装、鞋子、包、帽子)合并为一套完整穿搭。
- 室内设计: 使用 10 张家具图像生成完整的房间布局。
局部编辑与区域选择
Qwen-Image-2.1 提供三种指定编辑区域的方法:
- 圆形标记: 使用不同颜色的圆形标识多个区域,实现同时编辑(例如移除手表、改变发色、更换服装)。
- 涂绘注释: 用白色标记特定区域以添加新元素,例如在图像特定部分添加一名潜水员。
- 独立掩码: 接受原始图像和独立掩码作为两个独立输入,以保留原始内容的同时仅编辑掩码区域。
还可通过连续局部编辑创建简单动画,每次修改保留场景其余部分不变。
保真度与任务覆盖范围
该模型提升了肖像的人像特征保留能力(面部特征)和产品的一致性(文字、纹理和形状)。同时扩展了任务覆盖范围,包括:
- 全景图: 从一张自拍生成全景图。
- 信息图: 将模型照片扩展为详细构图。
- 分镜脚本: 将三视图角色参考转化为完整分镜脚本。
推理效率与架构
为优化推理性能,尤其是在使用多张参考图像时,Qwen-Image-2.1 采用混合粒度注意力架构。
- 注意力掩码: 文本、系统前缀和编辑指令使用基于 token 的因果掩码,而图像生成使用基于块的掩码。
- KV 缓存复用: 输入图像和编辑指令被视为静态上下文,在第一步中计算并缓存,以减少内存占用并提升速度。
视觉美学与排版
Qwen-Image-2.1 具有更精细的美学表现,尤其注重排版与人像。文本渲染现在考虑字体样式、布局以及文本与整体构图的关系。人像生成通过增强光照效果和细节表现,进一步提升真实感。