Qwen-Image-2.1 發布說明 / 新功能
Qwen-Image-2.1 在 7B 參數模型中統一了圖像生成與編輯
Qwen-Image-2.1 是一款開源圖像模型,將文字生成圖像與圖像編輯整合至單一架構中。它具備一個擁有 7B 參數與 32 層 Single-Stream DiT 的視覺生成組件,在保持高生成品質的同時,兼顧了推理效率並降低了運算成本。
原生透明度與統一創作
Qwen-Image-2.1 提供對生成與編輯透明圖像 (RGBA) 的原生支援,統一了先前在 Qwen-Image-Layered 等專用模型中才具備的功能。
- 文字轉透明度: 模型使用提示詞來決定輸出標準 RGB 圖像,還是帶有透明通道的圖像。
- 透明圖層編輯: 使用者可以在透明圖層內編輯元素——例如改變主體的表情或修改文字(例如將「BLOOM」替換為「Qwen-Image」)——同時保持透明背景。
- 主體提取: 模型可以處理 RGB 照片並提取特定主體作為帶有透明度的 RGBA 圖層,以便在設計與合成中使用。
進階圖像編輯功能
Qwen-Image-2.1 在圖像編輯方面引入了多項增強功能,重點在於參考能力、局部控制與保真度。
多重參考圖像
該模型支援最多 10 張參考圖像,允許將多個不同的資產組合成單一連貫的構圖。範例包括:
- 團體照: 將六張個人肖像組合成一張團體照。
- 虛擬試穿: 將五個輸入(模特兒、服裝、鞋子、包包與帽子)合併為一套完整的穿搭。
- 室內設計: 使用 10 張家具圖像來生成完整的房間佈置。
局部編輯與區域選擇
Qwen-Image-2.1 提供了三種指定編輯區域的方法:
- 圓圈: 使用不同顏色的圓圈來識別多個區域以進行同步編輯(例如:移除手錶、改變髮色與更換服裝)。
- 繪圖標註: 以白色標記特定區域來添加新元素,例如在圖像的特定部分添加一名潛水員。
- 獨立遮罩: 接受原始圖像與獨立遮罩作為兩個不同的輸入,以便在僅編輯遮罩區域的同時保留原始內容。
連續的局部編輯也可用於製作簡單的動畫,透過進行連續的更改同時保留場景的其餘部分。
保真度與任務覆蓋範圍
該模型改進了肖像的身份保留(面部特徵)以及產品的一致性(文字、紋理與形狀)。它還擴展了任務覆蓋範圍,包括:
- 全景圖: 從單張自拍照生成全景圖。
- 資訊圖表: 將模特兒照片擴展為詳細的構圖。
- 故事板: 將三視圖角色參考轉變為完整的故事板。
推理效率與架構
為了優化推理,特別是在使用多重參考圖像時,Qwen-Image-2.1 採用了混合粒度注意力架構。
- 注意力遮罩: 文字、系統前綴與編輯指令使用 Token 層級的因果遮罩,而圖像生成則使用區塊層級的遮罩。
- KV Cache 重用: 輸入圖像與編輯指令被視為靜態上下文,在第一步計算並快取,以減少記憶體使用量並提高速度。
視覺美學與排版
Qwen-Image-2.1 具備精緻的美學,重點在於排版與肖像畫。文字渲染現在會考慮字體樣式、佈局以及文字與整體構圖之間的關係。透過增強的照明與細節,肖像生成得到了進一步改進,呈現出更逼真的外觀。