Qwen-Image 發布:原生文字渲染與精準影像編輯

TL;DR

Qwen 已發布 Qwen-Image,一個 20B MMDiT 影像基礎模型,旨在解決 AI 生成圖像中高保真文字渲染的長期挑戰。該模型在多行版面、雙語文字(英語與中文)以及精準影像編輯方面表現卓越,於多項生成與編輯基準測試中超越現有的最先進模型。

原生文字渲染能力

Qwen-Image 在多種語言與版面上提供卓越的文字渲染,支援英語等字母語系與中文等表意文字。模型能夠處理複雜的語意與空間需求,包括:

  • 多行與段落渲染:模型能生成長段文字,包括在玻璃板等表面上的手寫風格,且即使文字僅佔總圖像面積的一小部分(不到十分之一),仍能保持精確度。
  • 複雜版面:Qwen-Image 能自動將文字與圖示排列成結構化格式,例如具多子模組的精美資訊圖、具層級文字(標題、副標題、演員、導演)的電影海報,以及企業風格的 PPT 投影片。
  • 雙語支援:模型可在同一圖像中切換英語與中文,並在兩種語言上皆保持高保真度。
  • 書法與風格化:模型支援特定藝術風格,例如傳統中文對聯與橫向卷軸的書法。

影像編輯與一般生成

除了文字渲染之外,Qwen-Image 是一個多功能的基礎模型,用於一般視覺內容創作:

  • 精準影像編輯:透過增強的多任務訓練範式,模型支援廣泛的編輯操作,包括風格轉換、添加或刪除物件、細節增強、編輯現有文字,以及調整角色姿勢,同時保留語意與視覺寫實性。
  • 一般生成:模型支援多種藝術風格,從寫實場景、動畫風格到印象派畫作與極簡設計皆可。

基準表現

Qwen-Image 在廣泛的公共基準測試中達到最先進(SOTA)表現,展示了其在生成與編輯兩方面的實力:

  • 一般影像生成:在 GenEval、DPG 與 OneIG-Bench 上進行評估。
  • 影像編輯:在 GEdit、ImgEdit 與 GSO 上進行評估。
  • 文字渲染:在 LongText-Bench、ChineseWord 與 TextCraft 上表現尤為突出,顯著超越先前的 SOTA 模型,尤其在中文文字生成方面。

Sources