Qwen-Image-2512 发布说明 / 新功能

Qwen-Image-2512 是一次基础的文本到图像模型更新,降低了典型的“AI 生成”美感,提升了真实感和细节精度。相较于八月发布的基础 Qwen-Image 模型,它在人物主体、自然纹理以及多模态文本组合的渲染上有显著改进。

模型性能与基准测试

Qwen-Image-2512 被定位为基于盲测的最强开源文本到图像模型。根据 Qwen 团队的说法,该模型在 AI Arena 上完成了超过 10,000 轮盲测,始终在与闭源替代品的竞争中保持高度竞争力。

增强的人体真实感

Qwen-Image-2512 大幅细化了人物的描绘,加入了更丰富的面部细节和更好的环境上下文。关键改进包括:

  • 年龄准确性: 模型能够精确捕捉年龄特征,例如老年人物的皱纹,避免了早期 AI 生成图像常见的人工平滑感。
  • 细节精细度: 对单根发丝的精确渲染取代了八月版本中出现的模糊纹理。
  • 语义遵循度: 模型更准确地遵循复杂的姿势指令,例如特定的身体倾斜或表情。
  • 环境融合度: 背景物体(例如宿舍家具或会议横幅)渲染得更清晰,并且与主体的融合度更高。

更细腻的自然细节与纹理

此更新将高保真渲染扩展到风景、野生动物和自然元素:

  • 自然与风景: 在水流、植被和瀑布雾的渲染上有明显提升,绿色的层次更丰富,雾气和喷雾等大气效果更逼真。
  • 动物皮毛: 模型在动物纹理上实现了高精度,例如金毛猎犬的护毛层与柔软底毛的明显分层,或是阿尔加利羊的粗糙密集毛皮。

改进的文字渲染与布局

Qwen-Image-2512 提升了图像内文字元素的准确性和布局,使得更复杂的多模态组合成为可能。展示的能力包括:

  • 结构化文档: 能够生成带有特定时间轴、标签和指向箭头的专业级 PPT 幻灯片。
  • 信息图表: 创建包含明确布局块、特定图标(例如锈蚀齿轮、圆锥形烧瓶)以及带有逻辑标记(如对号和红叉)的精确文字标签的工业技术信息图。
  • 复杂网格: 生成多面板教育海报(例如 3×4 网格),每个格子保持一致的叙事主题,同时又是独立的高质量摄影场景。

Sources