Qwen-Image-Edit 版本說明

Qwen-Image-Edit 是一個基於 20B Qwen-Image 基礎模型的專門影像編輯模型。它透過同時使用 Qwen2.5-VL 進行視覺語意控制以及 VAE Encoder 進行視覺外觀控制,實現高品質的語意與外觀編輯,並支援精確的雙語文字修改。

雙重控制架構:語意與外觀編輯

Qwen-Image-Edit 採用雙輸入機制,以處理兩種不同的影像修改類型:語意編輯與外觀編輯。

語意編輯

語意編輯會修改影像內容,同時保留原始的視覺語意與身份。這允許進行高層次的變更,雖然整體像素可能改變,但核心主體保持一致。主要功能包括:

  • IP 創建與一致性:模型能產生多樣化的內容,且在不同情境中保持相同角色(例如 Qwen 的水豚吉祥物),如製作主題表情符號套組。
  • 新視角合成:模型能執行物體 90 度或完整 180 度的旋轉,以顯示物體的背面。
  • 風格轉換:人像可被轉換成各種藝術風格,例如《千與千尋》風格,適用於虛擬化身創建等情境。

外觀編輯

外觀編輯聚焦於低層次的視覺修改,僅改變特定區域,而影像的其他部分保持完全不變。主要功能包括:

  • 元素修改:新增或移除特定元素,例如插入帶有相應倒影的招牌,或去除細小的頭髮絲。
  • 精確顏色調整:調整特定小元素的顏色,例如單字中的單一字母。
  • 環境變更:調整背景或更換人物的服裝。

精確雙語文字編輯

Qwen-Image-Edit 擴展了 Qwen-Image 的文字渲染能力,以支援精確的雙語(中文與英文)文字編輯。模型能在影像中新增、刪除或修改文字,同時保留原始的字型、大小與樣式。此功能可用於校正複雜的文字元素,包括大型標題以及中文海報中細小且精緻的細節。

鏈式編輯工作流程

Qwen-Image-Edit 支援鏈式、逐步的編輯流程,以校正複雜錯誤。使用者可在影像上繪製框選區域以標記需要修正的部位,並透過迭代方式逐步完善輸出。例如,在書法作品中,模型可逐一修正特定字形錯誤,細緻調整字的模糊部件,直至最終結果正確。

效能與可用性

在多項公開基準測試中的評估顯示,Qwen-Image-Edit 在影像編輯任務上達到最先進(SOTA)的表現。該模型可透過 Qwen Chat 的「Image Editing」功能使用,模型權重則託管於 GitHub、Hugging Face 與 ModelScope。

Sources