Qwen-Image-2.0 发布:专业信息图表与写实渲染
Qwen 宣布推出 Qwen-Image-2.0,这是一款下一代基础图像生成模型。该模型将图像生成和编辑统一到单一架构中,实现专业级排版、复杂信息图表的创建以及高保真写实渲染。
统一的生成与编辑架构
Qwen-Image-2.0 合并了之前并行的两条开发路线——生成(侧重于准确性和写实性)和编辑(侧重于功能性和一致性)。通过将它们统一为单一的“全能”模型,一方面的改进会直接惠及另一面。例如,模型的高级文本渲染能力使其能够在编辑过程中将诗歌或复杂文本写入已有图像,而无需切换流水线。
高级排版与信息图表能力
Qwen-Image-2.0 面向专业文档和图形设计而设计,在文本渲染方面具有五大关键优势:
- 精准("准"): 模型能够生成复杂的“画中画”组合,例如双轨时间线,同时保持元素之间的视觉一致性。
- 复杂性("多"): 支持 1k-token 指令,模型可以处理高度复杂的请求,包括包含多列、数据表和流程图的详细 A/B 测试报告。
- 美感("美"): 模型优化布局与构图,将文本放置在空白区域以避免遮挡视觉主体。它还支持多种书法风格,包括“细金”体和小楷(xiaokai)。
- 真实感("真"): 文本在不同介质上实现写实渲染,如玻璃白板、服装和杂志封面,保留自然光照、反射和透视。
- 对齐("齐"): 模型能够执行精确的结构对齐,例如 7 列日历网格或 4×6 漫画面板布局,且对话框中的文字居中。
写实与视觉保真度
除排版外,Qwen-Image-2.0 对非文本图像提供了显著升级:
- 原生 2K 分辨率: 模型支持 2048×2048 分辨率,可呈现皮肤毛孔、织物纹理、建筑质感和自然植被的微观细节。
- 细致的环境建模: 模型能够渲染具有高度生物和生态保真的复杂场景,例如拥有超过 23 种不同绿色且具真实廷德尔光束的夏季森林。
- 解剖精度: 模型展现出对复杂物理交互和肌肉结构的强大建模能力,例如一匹马站在人体之上,能够精确渲染汗水和皮肤纹理。
模型效率与性能
Qwen-Image-2.0 采用更轻量的模型架构,实现更快的推理速度。该模型被描述为 7B 架构,能够在秒级生成 2K 图像。AI Arena 上的盲测表明,作为统一模型,它在文本到图像和图像到图像基准测试中均表现出卓越性能。
图像编辑应用
由于是统一模型,Qwen-Image-2.0 支持多项高级编辑任务:
- 构图编辑: 将来自不同图像的多个主体合成为一张自然的照片,保持光照和景深的一致性。
- 跨维度编辑: 将平面卡通风格插图融合到真实世界的摄影背景中,同时保持原始照片的真实性。