Qwen-Image-3.0 发布说明"}],

Qwen-Image-3.0 发布说明

Qwen-Image-3.0 是第三代基础图像生成模型,旨在将 AI 图像从审美吸引力转向实际生产力。该模型专注于三个核心能力:针对复杂布局的丰富内容生成、真实的微观细节表现,以及用于多语言和界面渲染的深厚世界知识。

高密度布局与丰富内容

Qwen-Image-3.0 支持高达 4.5k token 的输入提示词,能够生成信息密集的视觉布局,而这类布局通常需要多次生成或手动拼接。

水平扩展与垂直扩展

  • 水平扩展(语义并置): 模型可以在单张图像中以有序的方式渲染多个不同的概念。开发者提供的一个示例包括一个包含九个复杂信息图表的 3×3 网格,其中包括物理抛体运动、生物寄生虫学和群论定理,全部在一次生成中完成。
  • 垂直扩展(逻辑嵌套): 模型支持“画中画”深度,允许进行嵌套界面。单条指令即可生成一个包含 Qwen Chat 界面的 VSCode 界面,而该界面又包含一个微信界面和一个咖啡海报。

真实的微观细节

渲染精度是 Qwen-Image-3.0 的重点,特别针对小文本的可读性和物理纹理的真实感。

文本渲染与学术精度

  • 小文本可读性: 模型可以渲染小至 10px 的文本。这通过生成包含密集 LaTeX 公式、下标、上标和希腊字母的详细知识信息图表和学术论文得到了证明。
  • 模拟媒体: 模型可以模拟报纸和手写注释的真实外观,包括模仿学生课堂笔记的红色墨水下划线和波浪线。

纹理与修复

  • 照片级真实纹理: 模型在人像摄影中捕捉皮肤毛孔和发丝等微观细节。
  • 艺术修复: Qwen-Image-3.0 可以执行编辑任务来修复受损的传统绘画,在保持原始水墨渐变和笔触的同时,去除霉斑和老化迹象。

深厚知识与多语言支持

Qwen-Image-3.0 利用世界知识来生成准确的界面和多语言内容。

  • 多语言渲染: 模型原生支持 12 种语言的渲染,包括日语、韩语和西班牙语。
  • UI 模拟: 它可以模拟主流数字界面,包括网页、游戏和直播布局。
  • 互联网集成: 模型可以连接到互联网以检索实时数据,例如为特定日期和地点生成天气预报图像。
  • 学术信息图表: 模型可以将标准照片(例如昆虫照片)转换为专业的科研图表,通过添加分类学信息、形态学注释和比例尺。

社区反馈与技术评议

虽然官方公告强调了生产力的重大飞跃,但 Hacker News 上的社区讨论揭示了关于模型部署和准确性的几个争议点。

模型访问与透明度

几位用户指出,关于模型权重和定价缺乏透明度。

"对于他们何时/是否会真正发布此模型的权重... 只字未提... 看起来完全是闭源权重。"

准确性与质量问题

尽管有“真实”细节的说法,但一些用户报告了输出中的不一致性:

  • 语言错误: 一位用户指出,促销示例中的韩语文本包含了几处元音和拼写错误(例如,"듘뢔마" 而不是 "벌래마")。
  • 解剖学问题: 一些用户在 chat.qwen.ai 上测试模型时报告看到了“第三条腿和发光的眼睛”,这表明解剖学正确性可能仍是一个挑战。
  • 虚假信息风险: 有人对模型生成具有说服力但错误的归属信息的能力表示担忧,例如一张声称由已故作者监督的漫画图像。

实际效用

用户对这些模型在电子商务中的应用表示怀疑,指出 AI 生成的服装试穿效果总是显得很完美,可能无法准确代表服装在真实人体上的穿着效果。

Sources