Qwen-Image-2.0 發布:專業資訊圖表與寫實渲染

Qwen 宣佈推出 Qwen-Image-2.0,這是一款次世代基礎圖像生成模型。該模型將圖像生成與編輯統一於單一架構,實現專業級排版、複雜資訊圖表製作以及高保真寫實渲染。

統一的生成與編輯架構

Qwen-Image-2.0 合併了先前平行的兩條開發路徑——生成(聚焦於精確度與寫實性)與編輯(聚焦於功能性與一致性)。透過將它們統一為單一的「全能」模型,一個領域的改進會直接惠及另一領域。例如,模型的先進文字渲染能力使其能在編輯過程中將詩句或複雜文字寫入現有圖像,而無需切換管線。

先進的排版與資訊圖表功能

Qwen-Image-2.0 為專業文件與平面設計而設計,具備文字渲染的五大關鍵優勢:

  • 精準(「准」):模型能產生複雜的「畫中畫」構圖,例如雙軌時間軸,同時保持元素之間的視覺一致性。
  • 複雜度(「多」):支援 1k 令牌指令,模型能處理高度複雜的需求,包括多欄位的 A/B 測試報告、資料表與流程圖等。
  • 美感(「美」):模型優化版面與構圖,將文字放置於空白區域以避免遮蔽視覺主體。亦支援各種書法風格,包括「細金」體與小楷。
  • 寫實(「真」):文字在不同媒介上呈現寫實效果,如玻璃白板、服裝與雜誌封面,保留自然光線、反射與透視。
  • 對齊(「齊」):模型能執行精確的結構對齊,例如 7 欄日曆格或 4x6 漫畫格布局,對話框內文字居中。

寫實與視覺保真度

除了排版之外,Qwen-Image-2.0 也為非文字圖像帶來顯著升級:

  • 原生 2K 解析度:模型支援 2048×2048 解析度,能呈現皮膚毛孔、布料紋理、建築材質與自然植被的微觀細節。
  • 細緻環境建模:模型能以高生物與生態保真度渲染複雜場景,例如擁有超過 23 種不同綠色調與寫實廷德爾光束的夏季森林。
  • 解剖精準度:模型展現出對複雜物理交互與肌肉結構的強大建模能力,例如一匹馬站在人體上方,能精確呈現汗水與皮膚紋理。

模型效率與效能

Qwen-Image-2.0 採用較輕量的模型架構,以實現更快的推論速度。該模型被描述為 7B 架構,能在數秒內生成 2K 圖像。於 AI Arena 進行的盲測顯示,作為統一模型,它在文字生成圖像與圖像到圖像兩項基準測試中皆表現出色。

圖像編輯應用

由於是統一模型,Qwen-Image-2.0 支援多項進階編輯任務:

  • 組合式編輯:將不同圖像中的多個主體合成為單一自然照片,保持光線與景深的一致性。
  • 跨維度編輯:將平面卡通風格插圖融合至真實世界的攝影背景,同時保留原始照片的真實感。

Sources