Qwen-Image-2512 发布说明 / 新功能
Qwen-Image-2512 是一次基础的文本到图像模型更新,降低了典型的“AI 生成”美感,提升了真实感和细节精度。相较于八月发布的基础 Qwen-Image 模型,它在人物主体、自然纹理以及多模态文本组合的渲染上有显著改进。
模型性能与基准测试
Qwen-Image-2512 被定位为基于盲测的最强开源文本到图像模型。根据 Qwen 团队的说法,该模型在 AI Arena 上完成了超过 10,000 轮盲测,始终在与闭源替代品的竞争中保持高度竞争力。
增强的人体真实感
Qwen-Image-2512 大幅细化了人物的描绘,加入了更丰富的面部细节和更好的环境上下文。关键改进包括:
- 年龄准确性: 模型能够精确捕捉年龄特征,例如老年人物的皱纹,避免了早期 AI 生成图像常见的人工平滑感。
- 细节精细度: 对单根发丝的精确渲染取代了八月版本中出现的模糊纹理。
- 语义遵循度: 模型更准确地遵循复杂的姿势指令,例如特定的身体倾斜或表情。
- 环境融合度: 背景物体(例如宿舍家具或会议横幅)渲染得更清晰,并且与主体的融合度更高。
更细腻的自然细节与纹理
此更新将高保真渲染扩展到风景、野生动物和自然元素:
- 自然与风景: 在水流、植被和瀑布雾的渲染上有明显提升,绿色的层次更丰富,雾气和喷雾等大气效果更逼真。
- 动物皮毛: 模型在动物纹理上实现了高精度,例如金毛猎犬的护毛层与柔软底毛的明显分层,或是阿尔加利羊的粗糙密集毛皮。
改进的文字渲染与布局
Qwen-Image-2512 提升了图像内文字元素的准确性和布局,使得更复杂的多模态组合成为可能。展示的能力包括:
- 结构化文档: 能够生成带有特定时间轴、标签和指向箭头的专业级 PPT 幻灯片。
- 信息图表: 创建包含明确布局块、特定图标(例如锈蚀齿轮、圆锥形烧瓶)以及带有逻辑标记(如对号和红叉)的精确文字标签的工业技术信息图。
- 复杂网格: 生成多面板教育海报(例如 3×4 网格),每个格子保持一致的叙事主题,同时又是独立的高质量摄影场景。