Qwen-VL-Plus 與 Qwen-VL-Max 發布

Qwen 推出了 Qwen-VL-Plus 與 Qwen-VL-Max,兩個升級版的 Qwen-VL 系列模型。這些模型大幅提升了與影像相關的推理、細節辨識,以及處理超過百萬像素且任意長寬比的高解析度影像的能力。

模型比較:Qwen-VL-Plus vs. Qwen-VL-Max

Qwen 提供了兩個不同版本的增強視覺語言模型,以在效能與能力之間取得平衡:

  • Qwen-VL-Plus:一個增強的大型視覺語言模型,設計用於細節辨識與文字辨識能力,支援超高像素解析度與任意長寬比。
  • Qwen-VL-Max:系列中最強大的模型,進一步提升視覺推理與指令遵循能力,以實現更高層次的認知理解與複雜任務。

效能基準

Qwen-VL-Plus 與 Qwen-VL-Max 在多項文字‑影像多模態任務上與 Gemini Ultra 與 GPT-4V 表現相當。值得注意的是,Qwen-VL-Max 在中文問答與中文文本理解方面超越 GPT-4V 與 Gemini。

模型 DocVQA ChartQA AI2D TextVQA MMMU MathVista MM-Bench-CN
Other Best Open-source LVLM 81.6% 68.4% 73.7% 76.1% 45.9% 36.7% 72.4%
Gemini Pro 88.1% 74.1% 73.9% 74.6% 47.9% 45.2% 74.3%
Gemini Ultra 90.9% 80.8% 79.5% 82.3% 59.4% 53.0% -
GPT-4V 88.4% 78.5% 78.2% 78.0% 56.8% 49.9% 73.9%
Qwen-VL-Plus 91.4% 78.1% 75.9% 78.9% 45.2% 43.3% 68.0%
Qwen-VL-Max 93.1% 79.8% 79.3% 79.5% 51.4% 50.0% 75.1%

主要技術能力

高解析度影像處理

Qwen-VL-Plus 與 Qwen-VL-Max 支援解析度超過百萬像素的影像以及各種長寬比的影像,讓模型能更精確地辨識影像與文字中的細節。

視覺推理與問題解決

除了簡單描述外,模型還能解讀流程圖、圖表、符號系統等複雜表示,包含數學問題求解與圖表分析。

視覺代理與定位

模型具備在影像中定位並查詢特定元素的能力,例如標示特定物件(如紅色汽車),並根據同一場景的上下文作出決策。

文字資訊辨識

Qwen-VL-Plus/Max 在中文與英文文字辨識方面有顯著提升。它們能有效從文件與表格中提取資訊,並重新格式化為自訂輸出格式(如 JSON),以處理大量文字。

可用性

Qwen-VL-Plus 與 Qwen-VL-Max 可透過以下方式取得:

  • Huggingface Spaces:提供 Plus 與 Max 兩個版本的示範。
  • QianWen Web Portal:提供 Qwen-VL-Max 的影像理解模式。
  • Dashscope APIs:兩個模型皆可透過 API 存取。

Sources