Qwen-VL-Plus 與 Qwen-VL-Max 發布
Qwen 推出了 Qwen-VL-Plus 與 Qwen-VL-Max,兩個升級版的 Qwen-VL 系列模型。這些模型大幅提升了與影像相關的推理、細節辨識,以及處理超過百萬像素且任意長寬比的高解析度影像的能力。
模型比較:Qwen-VL-Plus vs. Qwen-VL-Max
Qwen 提供了兩個不同版本的增強視覺語言模型,以在效能與能力之間取得平衡:
- Qwen-VL-Plus:一個增強的大型視覺語言模型,設計用於細節辨識與文字辨識能力,支援超高像素解析度與任意長寬比。
- Qwen-VL-Max:系列中最強大的模型,進一步提升視覺推理與指令遵循能力,以實現更高層次的認知理解與複雜任務。
效能基準
Qwen-VL-Plus 與 Qwen-VL-Max 在多項文字‑影像多模態任務上與 Gemini Ultra 與 GPT-4V 表現相當。值得注意的是,Qwen-VL-Max 在中文問答與中文文本理解方面超越 GPT-4V 與 Gemini。
| 模型 | DocVQA | ChartQA | AI2D | TextVQA | MMMU | MathVista | MM-Bench-CN |
|---|---|---|---|---|---|---|---|
| Other Best Open-source LVLM | 81.6% | 68.4% | 73.7% | 76.1% | 45.9% | 36.7% | 72.4% |
| Gemini Pro | 88.1% | 74.1% | 73.9% | 74.6% | 47.9% | 45.2% | 74.3% |
| Gemini Ultra | 90.9% | 80.8% | 79.5% | 82.3% | 59.4% | 53.0% | - |
| GPT-4V | 88.4% | 78.5% | 78.2% | 78.0% | 56.8% | 49.9% | 73.9% |
| Qwen-VL-Plus | 91.4% | 78.1% | 75.9% | 78.9% | 45.2% | 43.3% | 68.0% |
| Qwen-VL-Max | 93.1% | 79.8% | 79.3% | 79.5% | 51.4% | 50.0% | 75.1% |
主要技術能力
高解析度影像處理
Qwen-VL-Plus 與 Qwen-VL-Max 支援解析度超過百萬像素的影像以及各種長寬比的影像,讓模型能更精確地辨識影像與文字中的細節。
視覺推理與問題解決
除了簡單描述外,模型還能解讀流程圖、圖表、符號系統等複雜表示,包含數學問題求解與圖表分析。
視覺代理與定位
模型具備在影像中定位並查詢特定元素的能力,例如標示特定物件(如紅色汽車),並根據同一場景的上下文作出決策。
文字資訊辨識
Qwen-VL-Plus/Max 在中文與英文文字辨識方面有顯著提升。它們能有效從文件與表格中提取資訊,並重新格式化為自訂輸出格式(如 JSON),以處理大量文字。
可用性
Qwen-VL-Plus 與 Qwen-VL-Max 可透過以下方式取得:
- Huggingface Spaces:提供 Plus 與 Max 兩個版本的示範。
- QianWen Web Portal:提供 Qwen-VL-Max 的影像理解模式。
- Dashscope APIs:兩個模型皆可透過 API 存取。
Sources
- OriginalIntroducing Qwen-VL