Qwen2.5-VL-32B 發布說明
Qwen 已發布 Qwen2.5-VL-32B-Instruct,這是一款結合視覺與語言(VL)的模型,利用強化學習提升數學推理與影像理解能力。該模型以 Apache 2.0 授權開源。
主要改進與功能
Qwen2.5-VL-32B-Instruct 在先前的 Qwen2.5-VL 系列模型基礎上,引入了三項主要優化:
- Human Preference Alignment:輸出風格已調整為提供更詳細且格式更佳的答案,與人類偏好更為貼合。
- Enhanced Mathematical Reasoning:模型在解決複雜數學問題時的正確率顯著提升。
- Fine-grained Image Understanding:在影像解析、內容辨識與視覺邏輯推理等任務上,準確度與細節分析皆有所提升。
效能基準測試
Qwen2.5-VL-32B-Instruct 在與 Mistral-Small-3.1-24B、Gemma-3-27B-IT 等可比模型的比較中展現出優勢。值得注意的是,它在多個關鍵領域超越了更大的 Qwen2-VL-72B-Instruct:
- Multimodal Reasoning:模型在聚焦於複雜多步推理的基準測試中取得顯著優勢,特別是 MMMU、MMMU-Pro 與 MathVista。
- User Experience:在評估主觀使用者體驗的 MM-MT-Bench 上,Qwen2.5-VL-32B-Instruct 以大幅領先的表現超過 Qwen2-VL-72B-Instruct。
- Text Capabilities:在純文字能力方面,該模型相較於同規模的其他模型亦達到頂尖表現。
視覺推理實務應用
模型的能力透過需要結合視覺資料與邏輯、數學步驟的複雜視覺任務得以展示:
- Visual Logic Deduction:在駕駛情境中,模型能辨識限速標誌(卡車 100 km/h),計算特定距離(110 km)的行駛時間,並判斷是否能在指定時間內抵達目的地。
- Geometric Reasoning:模型可透過分析圖像中的交叉線與角平分線,解決幾何問題並計算特定角度。
- Detailed Image Parsing:模型能辨識圖像中的特定文化標誌(如紅辣椒與四川花椒底座以及分割鍋具設計),正確判斷此菜為四川麻辣火鍋。
未來研究方向
雖然 Qwen2.5-VL-32B 透過「快速思考」範式著重於優化主觀體驗與數學推理,Qwen 團隊表示其下一個研究重點將是 長且有效的推理過程。此方向旨在突破視覺模型在解決高度複雜、多步驟視覺推理任務上的界限。