Qwen-Image-2512 發行說明 / 新功能
Qwen-Image-2512 是一項基礎的文本到圖像模型更新,減少了典型的「AI 生成」美感,轉而追求更高的寫實度與更精細的細節。與八月發布的基礎 Qwen-Image 模型相比,它特別提升了對人物主體、自然紋理以及多模態文字組合的渲染效果。
模型效能與基準測試
Qwen-Image-2512 被定位為基於盲測評的最強開源文本到圖像模型。根據 Qwen 團隊的說法,該模型在 AI Arena 上進行了超過 10,000 輪的盲測評,始終在與封閉源碼替代方案的競爭中保持高度競爭力。
加強的人物寫實度
Qwen-Image-2512 大幅精緻了人物的描繪,加入了更豐富的臉部細節與更佳的環境脈絡。主要改進包括:
- 年齡準確性: 模型精確捕捉與年齡相關的線索,例如老年受試者的皺紋,避免了早期 AI 生成圖像常見的人工平滑感。
- 精細細節: 在渲染單根髮絲方面的精確度取代了八月版本中模糊的紋理。
- 語意遵循度: 模型更準確地遵循複雜的姿勢指示,例如特定的身體傾斜或表情。
- 環境整合度: 背景物件(例如宿舍家具或會議橫幅)以更清晰的方式渲染,且與主體的整合度更佳。
更精細的自然細節與紋理
此更新將高保真渲染擴展至風景、野生動物與自然元素:
- 自然與風景: 在水流、植被與瀑布霧的渲染上顯著提升,綠色層次更豐富,且霧氣與噴濺等大氣效果更寫實。
- 動物毛皮: 模型在動物紋理上達到高度精確,例如金毛尋回犬的外層護毛與柔軟底毛的明顯層次,或是阿爾加利羊的粗糙密集毛皮。
改進的文字渲染與版面配置
Qwen-Image-2512 提升了圖像內文字元素的準確性與版面配置,使得更複雜的多模態組合成為可能。展示的能力包括:
- 結構化文件: 能夠生成具備特定時間軸、標籤與方向箭頭的專業級 PPT 投影片。
- 資訊圖表: 製作包含明確版面區塊、特定圖示(例如生鏽齒輪、圓錐形燒瓶)以及帶有邏輯標記(如勾號與紅叉)的精確文字標籤的工業技術資訊圖表。
- 複雜格子: 生成多面板教育海報(例如 3x4 格子),每個格子在保持一致敘事主題的同時,仍呈現獨立且高品質的攝影場景。