Qwen VLo:統一的多模態理解與生成

Qwen VLo 是一個統一的多模態模型,旨在彌合視覺感知與創意生成之間的鴻溝。與先前主要聚焦於理解的模型不同,Qwen VLo 能同時「理解」世界並根據該理解生成高品質的再創作,讓使用者能在單一介面中從分析轉向創作。

統一的多模態能力

Qwen VLo 將多模態理解與生成整合於單一框架,實現文字與影像之間的雙向流動。模型支援三種主要的操作模式:

1. 開放式影像編輯與重建

Qwen VLo 支援使用自然語言的指令式編輯。這讓使用者能對現有影像進行複雜的修改,同時保持語意一致性與結構完整性。主要功能包括:

  • 風格轉換: 將影像轉換為特定的藝術風格,例如吉卜力、海賊王、龍珠或皮克斯 3D。
  • 物件修改: 添加、移除或替換物件(例如,將西瓜換成榴槤,或為狗加上一頂紅帽子)。
  • 場景重建: 更換背景(例如,將主體從房間移至埃菲爾鐵塔)或改變整體氛圍。
  • 複雜指令: 在單一指令中執行多步驟任務,例如製作具特定版面配置、配色方案與手寫文字的宣傳海報。

2. 文本到影像生成

除了編輯之外,模型還能根據文字提示生成全新的影像。它支援中英雙語指令,能產出多樣化的結果,從寫實照片與 3D 渲染到傳統水墨畫與排版藝術皆可。

3. 視覺感知與定位

Qwen VLo 保持強大的理解能力,能透過簡單的編輯指令執行傳統電腦視覺任務:

  • 偵測與分割: 產生偵測框或分割遮罩(例如,使用紅色遮罩分割香蕉)。
  • 邊緣偵測: 為影像預測邊緣偵測圖。
  • 自我分析: 模型能重新分析其生成的影像,以辨識特定細節,例如剛創建的狗或貓的品種。

技術實作與機制

Qwen VLo 採用特定的架構設計,以提升輸出的彈性與控制力:

漸進式生成過程

Qwen VLo 採用一種生成機制,從上至下、從左至右逐步構建影像。此方法旨在提升生成效率並提供更佳的控制,尤其適用於包含長段文字或複雜版面(如漫畫格)等任務。

動態解析度支援

透過動態解析度訓練,模型支援任意解析度與長寬比的輸入與輸出影像。此舉消除固定格式的限制,讓使用者能創建長條格式(如 4:1 或 1:3 比例),適用於網站橫幅或社群媒體封面。

目前的限制與未來方向

作為預覽版,Qwen VLo 目前仍面臨多項挑戰:

  • 穩定性: 可能出現不準確、與原始影像不一致,或未能遵守特定指令的情況。
  • 意圖辨識: 模型有時難以穩定辨識生成影像背後的意圖。

展望未來,Qwen 團隊希望利用生成能力來監督與精進理解。透過產生中間結果(如分割或偵測圖),模型能驗證自身的視覺理解,進一步提升整體效能。

Sources