Qwen VLo:统一的多模态理解与生成

Qwen VLo 是一个统一的多模态模型,旨在弥合视觉感知与创意生成之间的差距。不同于主要侧重于理解的以往模型,Qwen VLo 能够既“理解”世界,又基于这种理解生成高质量的再现,使用户能够在单一界面中从分析转向创作。

统一的多模态能力

Qwen VLo 将多模态理解与生成整合到同一框架中,实现文本与图像之间的双向流动。模型支持三种主要的运行模式:

1. 开放式图像编辑与再创作

Qwen VLo 支持使用自然语言的指令式编辑。这使用户能够在保持语义一致性和结构完整性的前提下,对现有图像进行复杂的修改。关键能力包括:

  • 风格迁移: 将图像转换为特定的艺术风格,如《千与千寻》、《海贼王》、《龙珠》或皮克斯 3D。
  • 对象修改: 添加、删除或替换对象(例如,将西瓜换成榴莲,或给狗加上一顶红帽子)。
  • 场景重建: 更换背景(例如,将主体从房间移动到埃菲尔铁塔)或改变整体氛围。
  • 复杂指令: 在单一指令中执行多步骤任务,例如创建具有特定布局、配色方案和手写文字的宣传海报。

2. 文本到图像生成

除了编辑之外,模型还能根据文本提示生成全新的图像。它支持中英双语指令,能够产出多种形式的输出,从写实照片、3D 渲染到传统水墨画和排版艺术。

3. 视觉感知与定位

Qwen VLo 保留了强大的理解能力,能够通过简易的编辑指令执行传统的计算机视觉任务:

  • 检测与分割: 生成检测框或分割掩码(例如,使用红色掩码对香蕉进行分割)。
  • 边缘检测: 为图像预测边缘检测图。
  • 自我分析: 模型可以重新分析其生成的图像,以识别特定细节,例如它刚刚创建的狗或猫的品种。

技术实现与机制

Qwen VLo 采用特定的架构选择,以提升输出的灵活性和可控性:

渐进式生成过程

Qwen VLo 使用一种生成机制,按自上而下、从左到右的顺序逐步构建图像。此方法旨在提升生成效率并提供更好的控制,尤其适用于包含长文本段落或复杂布局(如漫画格子)的任务。

动态分辨率支持

通过动态分辨率训练,模型支持任意分辨率和宽高比的输入与输出图像。这消除了固定格式的限制,使得能够创建适用于网页横幅或社交媒体封面的超长比例(如 4:1 或 1:3)图像。

当前局限性与未来方向

作为预览版,Qwen VLo 目前面临若干挑战:

  • 稳定性: 可能出现不准确、与原图不一致或未能遵循特定指令的情况。
  • 意图识别: 模型有时难以稳定地识别生成图像背后的意图。

展望未来,Qwen 团队计划利用生成能力来监督和完善理解。通过生成中间结果(如分割图或检测图),模型可以自行验证视觉理解,从而进一步提升整体性能。

Sources