Qwen-Image-2.1 發布:具原生透明度的 7B 統一文字轉圖像與編輯模型
TL;DR
Qwen-Image-2.1 是一款輕量級的 7 B 觀覺生成模型,可在單一模型中支援文字轉圖像生成與圖像編輯——包括原生 RGBA 透明度,並能在 RTX 4090 上以約五秒的時間生成 1 MP 圖像,效率極高。
輕量架構與推論優化
結論: 模型的輕量設計(32 個 Single‑Stream DiT 層,7 B 參數)在計算成本低的情況下,仍能提供具競爭力的圖像品質。
- 觀覺生成元件由 32 個 DiT 層組成,總共 7 B 參數,明顯小於 20 B 的 Qwen‑Image‑1,且與 6 B 的 Z‑Image Turbo 相當。
- 採用混合粒度注意力機制,將文字的 token 級因果遮罩與圖像生成的 chunk 級遮罩分離。這使得 KV‑cache 重用 成為可能:輸入圖像與編輯指令僅需計算一次並快取,進而在多圖像編輯時降低延遲與記憶體使用。
- 在 Qwen‑Image‑Bench 上的基準測試顯示,Qwen‑Image‑2.1 的表現與許多封閉原始碼替代方案相當或更優,且運行成本遠低於後者。
原生透明度與統一生成/編輯
結論: 透明度已直接內建於模型中,無需額外的背景移除流程。
- 模型會根據提示內容,決定輸出 RGB 圖像或帶有透明通道的 RGBA 圖像。
- 可生成簡單的透明資產(如圖示、商標),也能處理包含多個元素的複雜組合。
- 編輯可作用於透明圖層:表達、顏色,甚至嵌入的文字皆可修改,同時保留 alpha 通道。
- 模型能從一般的 RGB 照片中提取主體,並輸出乾淨的 RGBA 層,為設計師簡化資產重用流程。
多樣化的編輯功能
多個參考圖像
結論: 最多可將十張參考圖像整合為單一連貫輸出,支援複雜場景構圖。
- 範例:六張人物肖像參考合併為一張群像照片。
- 範例:五件時尚單品(模特、服裝、鞋履、包包、帽子)整合為一套完整穿搭。
- 範例:十張家具圖片用於生成完整佈置的室內空間。
靈活的區域選擇
結論: 使用者可透過圓形、繪製註記或獨立遮罩指定編輯區域,實現細緻控制。
- 圓形引導編輯可同時修改多個區域(例如移除手錶、重新上色頭髮、更換服裝)。
- 繪製引導編輯允許使用者繪製任意形狀,指示新內容應出現的位置。
- 遮罩引導編輯可保留原始圖像不變,模型僅填補遮罩區域,支援簡單動畫的序列編輯。
質量提升
結論: 模型在人像中更好地保留身份特徵,並維持產品細節,如文字、紋理與形狀。
- 人像範例顯示編輯過程中面部特徵保持一致。
- 產品範例顯示商標、字型與材質紋理在操作後仍穩定不變。
擴展的任務覆蓋範圍
結論: Qwen‑Image‑2.1 可處理全景圖、資訊圖表與故事板,展現其超越單一圖像生成的適應性。
- 自拍可擴展為全寬全景圖。
- 模特照片可轉換為詳細資訊圖表。
- 三視角角色草圖可轉換為多面板故事板。
視覺品質:紋理、字型與人像光照
結論: 相較於先前的開源版本,模型在文字渲染與人像光照方面更為清晰真實。
- 文字渲染尊重字型風格、版面配置與周圍圖形的整合,產生可讀性高的小字元素。
- 人像展現更佳的照明效果、細緻的面部細節與自然的陰影。
社群反饋精選
- 正面: 使用者讚譽其在網頁設計任務中的文字渲染表現,並注意到模型速度(RTX 4090 上生成 1 MP 圖像約需 5 秒)。原生透明度功能被視為開源模型中的獨特優勢。
- 負面: 授權條款比早期 Qwen 版本更為嚴格,明確禁止未經另行協議的商業使用。部分使用者報告偶發的提示遵循問題與殘留的 VAE 藝術效果。
- 觀察: 多位使用者將模型與封閉原始碼競爭對手相比,認為其具成本效益優勢;也有觀點指出,開源社群最終可能繞過授權限制。
實用考量
- 安裝: 模型可在 GitHub、Hugging Face 與 ModelScope 上取得。使用者可透過提供的
convrot推論腳本快速生成圖像。 - 硬體需求: 現代 GPU(如 RTX 4090)可在約 5 秒內生成 1 MP 圖像;較低階 GPU 則會有相應的更高延遲。
- 授權: Qwen RESEARCH LICENSE 限制商業使用。部署至生產環境前,請務必審閱 GitHub 倉庫中的授權文件。
總結
Qwen‑Image‑2.1 展示了 7 B 的擴散模型如何在保持快速與低成本的同時,提供高品質、具透明度感知的圖像生成與複雜的多圖像編輯能力。其統一方法簡化了設計師、電商創作者與視覺敘事者的流程,但嚴格的授權條款可能限制其商業應用。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch