Qwen-Image-3.0 版本說明

Qwen 推出了 Qwen-Image-3.0,這是一款第三代基礎圖像生成模型,旨在將圖像生成從僅僅追求美學轉變為實用的生產力工具。模型以「Real」(實) 為核心概念,透過三大技術支柱實現:豐富內容、真實細節與深度知識。

豐富內容:複雜版面與高令牌輸入

Qwen-Image-3.0 能夠透過將可接受的指令長度提升至 4.5k 令牌,渲染極度複雜且資訊密集的視覺版面。這使模型能同時處理圖像構圖中的水平擴展與垂直深度。

水平擴展與空間控制

模型展現出高度的語意並置與空間控制能力,能在單一圖像中佈局多個不同概念而不互相干擾。此能力的例子為一次性生成 3x3 網格,每個格子根據 3.7k 令牌的提示,包含複雜資訊圖(例如數學符號、生物說明與醫學圖表)。

垂直深度與邏輯巢狀

除了平行元素外,模型還支援語意解構與邏輯巢狀。它能在單一圖像中逐層渲染多個巢狀介面,例如一個 VSCode 介面內嵌 Qwen Chat 介面,該介面又包含 WeChat 介面與咖啡海報,同時保留每個 UI 層的真實風格。

真實細節:微觀層級精準

Qwen-Image-3.0 在微觀層級細節上達到高度渲染精準度,著重於可讀性與攝影寫實感。

精確文字渲染

模型能渲染至小至 10px 的文字,使其在密集環境中仍具可讀性。主要能力包括:

  • 學術論文: 精確渲染 LaTeX 公式、下標、上標、希臘字母與定理編號。
  • 寫實文件: 生成報紙格式的密集文字,模擬實體報紙的真實外觀。
  • 手寫註解: 能覆蓋逼真的紅色手寫筆記,包括底線與箭頭,模擬學生的課堂筆記。

紋理與修復

模型能產生逼真的皮膚紋理,包含毛孔與髮絲。在編輯任務中,它可透過保留原始藝術風格、墨跡漸層與筆觸,修復受損的傳統畫作,同時去除黴斑與破損。

深度知識:多語言與世界認知

Qwen-Image-3.0 利用廣博的世界知識,渲染多樣的風格與介面。

多語言與 UI 支援

模型原生支援 12 種語言,並支援超過 100 種藝術風格。它能模擬主流的網頁、遊戲與直播使用者介面。

知識驅動生成

模型能將簡單照片轉換為專業研究圖表,加入分類資訊、形態註解與比例尺。此外,它可連接網路取得即時資訊,例如生成特定日期與地點的天氣預報圖,或將特定 IP 圖像嵌入場景中。

Sources