Qwen2.5-VL-32B 發布說明

Qwen 已發布 Qwen2.5-VL-32B-Instruct,這是一款結合視覺與語言(VL)的模型,利用強化學習提升數學推理與影像理解能力。該模型以 Apache 2.0 授權開源。

主要改進與功能

Qwen2.5-VL-32B-Instruct 在先前的 Qwen2.5-VL 系列模型基礎上,引入了三項主要優化:

  • Human Preference Alignment:輸出風格已調整為提供更詳細且格式更佳的答案,與人類偏好更為貼合。
  • Enhanced Mathematical Reasoning:模型在解決複雜數學問題時的正確率顯著提升。
  • Fine-grained Image Understanding:在影像解析、內容辨識與視覺邏輯推理等任務上,準確度與細節分析皆有所提升。

效能基準測試

Qwen2.5-VL-32B-Instruct 在與 Mistral-Small-3.1-24B、Gemma-3-27B-IT 等可比模型的比較中展現出優勢。值得注意的是,它在多個關鍵領域超越了更大的 Qwen2-VL-72B-Instruct

  • Multimodal Reasoning:模型在聚焦於複雜多步推理的基準測試中取得顯著優勢,特別是 MMMUMMMU-ProMathVista
  • User Experience:在評估主觀使用者體驗的 MM-MT-Bench 上,Qwen2.5-VL-32B-Instruct 以大幅領先的表現超過 Qwen2-VL-72B-Instruct。
  • Text Capabilities:在純文字能力方面,該模型相較於同規模的其他模型亦達到頂尖表現。

視覺推理實務應用

模型的能力透過需要結合視覺資料與邏輯、數學步驟的複雜視覺任務得以展示:

  • Visual Logic Deduction:在駕駛情境中,模型能辨識限速標誌(卡車 100 km/h),計算特定距離(110 km)的行駛時間,並判斷是否能在指定時間內抵達目的地。
  • Geometric Reasoning:模型可透過分析圖像中的交叉線與角平分線,解決幾何問題並計算特定角度。
  • Detailed Image Parsing:模型能辨識圖像中的特定文化標誌(如紅辣椒與四川花椒底座以及分割鍋具設計),正確判斷此菜為四川麻辣火鍋。

未來研究方向

雖然 Qwen2.5-VL-32B 透過「快速思考」範式著重於優化主觀體驗與數學推理,Qwen 團隊表示其下一個研究重點將是 長且有效的推理過程。此方向旨在突破視覺模型在解決高度複雜、多步驟視覺推理任務上的界限。

Sources