Qwen-Image-3.0 发布说明
Qwen 推出了 Qwen-Image-3.0,这是一款第三代基础图像生成模型,旨在将图像生成从单纯的审美转变为实用的生产力工具。模型围绕“真实”(实) 的概念展开,通过三大技术支柱实现:丰富内容、真实细节和深度知识。
丰富内容:复杂布局与高 Token 输入
Qwen-Image-3.0 通过将可接受的指令长度提升至 4.5k token,能够渲染极其复杂、信息密集的视觉布局。这使得模型能够在图像构图中同时处理横向扩展和纵向深度。
横向扩展与空间控制
模型展示了高度的语义并置和空间控制能力,使其能够在单幅图像中布局多个不同概念而不相互干扰。该能力的示例是一次性生成 3×3 网格,每个格子包含复杂的信息图(例如数学符号、生物学解释、医学图表),基于 3.7k token 的提示词。
纵向深度与逻辑嵌套
除了并列元素外,模型还支持语义拆解和逻辑嵌套。它能够在单幅图像中逐层渲染多个嵌套界面,例如在 VSCode 界面中嵌入 Qwen Chat 界面,进而再嵌入微信界面和咖啡海报,同时保留每一层 UI 的真实风格。
真实细节:微观层面精度
Qwen-Image-3.0 在微观细节的渲染精度上表现出色,注重可读性和摄影写实感。
精准文本渲染
模型能够渲染至小至 10px 的文本,使其在密集环境中仍保持可读。关键能力包括:
- 学术论文: 精准渲染 LaTeX 公式、下标、上标、希腊字母以及定理编号。
- 真实文档: 在报纸格式中生成密集文本,模拟实体报纸的真实外观。
- 手写批注: 能够叠加逼真的红色手写笔记,包括下划线和箭头,模拟学生的课堂笔记。
纹理与修复
模型能够生成逼真的皮肤纹理,包括毛孔和发丝。在编辑任务中,它可以通过保持原有的艺术风格、墨洗渐变和笔触,修复受损的传统绘画,同时去除霉斑和破损。
深度知识:多语言与世界认知
Qwen-Image-3.0 利用广博的世界知识来渲染多种风格和界面。
多语言与 UI 支持
模型原生支持 12 种语言,并支持超过 100 种艺术风格。它能够模拟主流的网页、游戏和直播的用户界面。
知识驱动的生成
模型可以通过添加分类信息、形态学注释和比例尺,将普通照片转化为专业的科研图形。此外,它还能联网获取最新信息,例如生成特定日期和地点的天气预报图,或将特定的 IP 形象嵌入场景中。