Qwen-Image-2.1 發布:具原生透明度的 7B 統一文字轉圖像與編輯模型

TL;DR

Qwen-Image-2.1 是一款輕量級的 7 B 觀覺生成模型,可在單一模型中支援文字轉圖像生成與圖像編輯——包括原生 RGBA 透明度,並能在 RTX 4090 上以約五秒的時間生成 1 MP 圖像,效率極高。


輕量架構與推論優化

結論: 模型的輕量設計(32 個 Single‑Stream DiT 層,7 B 參數)在計算成本低的情況下,仍能提供具競爭力的圖像品質。

  • 觀覺生成元件由 32 個 DiT 層組成,總共 7 B 參數,明顯小於 20 B 的 Qwen‑Image‑1,且與 6 B 的 Z‑Image Turbo 相當。
  • 採用混合粒度注意力機制,將文字的 token 級因果遮罩與圖像生成的 chunk 級遮罩分離。這使得 KV‑cache 重用 成為可能:輸入圖像與編輯指令僅需計算一次並快取,進而在多圖像編輯時降低延遲與記憶體使用。
  • 在 Qwen‑Image‑Bench 上的基準測試顯示,Qwen‑Image‑2.1 的表現與許多封閉原始碼替代方案相當或更優,且運行成本遠低於後者。

原生透明度與統一生成/編輯

結論: 透明度已直接內建於模型中,無需額外的背景移除流程。

  • 模型會根據提示內容,決定輸出 RGB 圖像或帶有透明通道的 RGBA 圖像。
  • 可生成簡單的透明資產(如圖示、商標),也能處理包含多個元素的複雜組合。
  • 編輯可作用於透明圖層:表達、顏色,甚至嵌入的文字皆可修改,同時保留 alpha 通道。
  • 模型能從一般的 RGB 照片中提取主體,並輸出乾淨的 RGBA 層,為設計師簡化資產重用流程。

多樣化的編輯功能

多個參考圖像

結論: 最多可將十張參考圖像整合為單一連貫輸出,支援複雜場景構圖。

  • 範例:六張人物肖像參考合併為一張群像照片。
  • 範例:五件時尚單品(模特、服裝、鞋履、包包、帽子)整合為一套完整穿搭。
  • 範例:十張家具圖片用於生成完整佈置的室內空間。

靈活的區域選擇

結論: 使用者可透過圓形、繪製註記或獨立遮罩指定編輯區域,實現細緻控制。

  • 圓形引導編輯可同時修改多個區域(例如移除手錶、重新上色頭髮、更換服裝)。
  • 繪製引導編輯允許使用者繪製任意形狀,指示新內容應出現的位置。
  • 遮罩引導編輯可保留原始圖像不變,模型僅填補遮罩區域,支援簡單動畫的序列編輯。

質量提升

結論: 模型在人像中更好地保留身份特徵,並維持產品細節,如文字、紋理與形狀。

  • 人像範例顯示編輯過程中面部特徵保持一致。
  • 產品範例顯示商標、字型與材質紋理在操作後仍穩定不變。

擴展的任務覆蓋範圍

結論: Qwen‑Image‑2.1 可處理全景圖、資訊圖表與故事板,展現其超越單一圖像生成的適應性。

  • 自拍可擴展為全寬全景圖。
  • 模特照片可轉換為詳細資訊圖表。
  • 三視角角色草圖可轉換為多面板故事板。

視覺品質:紋理、字型與人像光照

結論: 相較於先前的開源版本,模型在文字渲染與人像光照方面更為清晰真實。

  • 文字渲染尊重字型風格、版面配置與周圍圖形的整合,產生可讀性高的小字元素。
  • 人像展現更佳的照明效果、細緻的面部細節與自然的陰影。

社群反饋精選

  • 正面: 使用者讚譽其在網頁設計任務中的文字渲染表現,並注意到模型速度(RTX 4090 上生成 1 MP 圖像約需 5 秒)。原生透明度功能被視為開源模型中的獨特優勢。
  • 負面: 授權條款比早期 Qwen 版本更為嚴格,明確禁止未經另行協議的商業使用。部分使用者報告偶發的提示遵循問題與殘留的 VAE 藝術效果。
  • 觀察: 多位使用者將模型與封閉原始碼競爭對手相比,認為其具成本效益優勢;也有觀點指出,開源社群最終可能繞過授權限制。

實用考量

  • 安裝: 模型可在 GitHub、Hugging Face 與 ModelScope 上取得。使用者可透過提供的 convrot 推論腳本快速生成圖像。
  • 硬體需求: 現代 GPU(如 RTX 4090)可在約 5 秒內生成 1 MP 圖像;較低階 GPU 則會有相應的更高延遲。
  • 授權: Qwen RESEARCH LICENSE 限制商業使用。部署至生產環境前,請務必審閱 GitHub 倉庫中的授權文件。

總結

Qwen‑Image‑2.1 展示了 7 B 的擴散模型如何在保持快速與低成本的同時,提供高品質、具透明度感知的圖像生成與複雜的多圖像編輯能力。其統一方法簡化了設計師、電商創作者與視覺敘事者的流程,但嚴格的授權條款可能限制其商業應用。

Sources

相關