Qwen-Image-Edit 版本說明
Qwen-Image-Edit 是一個基於 20B Qwen-Image 基礎模型的專門影像編輯模型。它透過同時使用 Qwen2.5-VL 進行視覺語意控制以及 VAE Encoder 進行視覺外觀控制,實現高品質的語意與外觀編輯,並支援精確的雙語文字修改。
雙重控制架構:語意與外觀編輯
Qwen-Image-Edit 採用雙輸入機制,以處理兩種不同的影像修改類型:語意編輯與外觀編輯。
語意編輯
語意編輯會修改影像內容,同時保留原始的視覺語意與身份。這允許進行高層次的變更,雖然整體像素可能改變,但核心主體保持一致。主要功能包括:
- IP 創建與一致性:模型能產生多樣化的內容,且在不同情境中保持相同角色(例如 Qwen 的水豚吉祥物),如製作主題表情符號套組。
- 新視角合成:模型能執行物體 90 度或完整 180 度的旋轉,以顯示物體的背面。
- 風格轉換:人像可被轉換成各種藝術風格,例如《千與千尋》風格,適用於虛擬化身創建等情境。
外觀編輯
外觀編輯聚焦於低層次的視覺修改,僅改變特定區域,而影像的其他部分保持完全不變。主要功能包括:
- 元素修改:新增或移除特定元素,例如插入帶有相應倒影的招牌,或去除細小的頭髮絲。
- 精確顏色調整:調整特定小元素的顏色,例如單字中的單一字母。
- 環境變更:調整背景或更換人物的服裝。
精確雙語文字編輯
Qwen-Image-Edit 擴展了 Qwen-Image 的文字渲染能力,以支援精確的雙語(中文與英文)文字編輯。模型能在影像中新增、刪除或修改文字,同時保留原始的字型、大小與樣式。此功能可用於校正複雜的文字元素,包括大型標題以及中文海報中細小且精緻的細節。
鏈式編輯工作流程
Qwen-Image-Edit 支援鏈式、逐步的編輯流程,以校正複雜錯誤。使用者可在影像上繪製框選區域以標記需要修正的部位,並透過迭代方式逐步完善輸出。例如,在書法作品中,模型可逐一修正特定字形錯誤,細緻調整字的模糊部件,直至最終結果正確。
效能與可用性
在多項公開基準測試中的評估顯示,Qwen-Image-Edit 在影像編輯任務上達到最先進(SOTA)的表現。該模型可透過 Qwen Chat 的「Image Editing」功能使用,模型權重則託管於 GitHub、Hugging Face 與 ModelScope。