Qwen-Image 发布:原生文本渲染与精确图像编辑

TL;DR

Qwen 发布了 Qwen-Image,这是一款 20B MMDiT 图像基础模型,旨在解决 AI 生成图像中高保真文本渲染的长期难题。该模型在多行布局、双语文本(英文和中文)以及精确图像编辑方面表现出色,在多个生成和编辑基准上超越了现有的最先进模型。

原生文本渲染能力

Qwen-Image 在多种语言和布局下提供卓越的文本渲染,支持英文字母等字母语言和中文等表意文字。该模型能够处理复杂的语义和空间需求,包括:

  • 多行和段落渲染:模型可以生成长段文本,包括在玻璃板等表面上的手写风格,并且即使文本仅占总图像面积的一小部分(不到十分之一),也能保持准确性。
  • 复杂布局:Qwen-Image 能自动将文本和图标排列成结构化格式,例如具有多个子模块的精美信息图、层次分明的电影海报(标题、副标题、演员、导演)以及企业风格的 PPT 幻灯片。
  • 双语支持:模型可以在同一图像中在英文和中文之间切换,并在两种语言中保持高保真度。
  • 书法与风格化:模型支持特定的艺术风格,例如用于对联和横幅的传统中文书法。

图像编辑与通用生成

除了文本渲染,Qwen-Image 还是一个用于通用视觉内容创作的多功能基础模型:

  • 精确图像编辑:通过增强的多任务训练范式,模型支持广泛的编辑操作,包括风格迁移、添加或删除对象、细节增强、编辑已有文本以及在保持语义和视觉真实感的同时调整人物姿势。
  • 通用生成:模型支持多种艺术风格,从写实场景、动漫风格到印象派绘画和极简设计。

基准性能

Qwen-Image 在广泛的公开基准测试中实现了业界领先(SOTA)的性能,展示了其在生成和编辑两方面的优势:

  • 通用图像生成:在 GenEval、DPG 和 OneIG-Bench 上进行评估。
  • 图像编辑:在 GEdit、ImgEdit 和 GSO 上进行评估。
  • 文本渲染:在 LongText-Bench、ChineseWord 和 TextCraft 上表现尤为突出,显著超越了之前的 SOTA 模型,尤其在中文文本生成方面。

Sources