QVQ-72B-Preview 發布
Qwen 已推出 QVQ-72B-Preview,這是一個專為複雜多模態推理設計的開放權重模型。基於 Qwen2-VL-72B,QVQ-72B-Preview 經過設計以提升 AI 在視覺理解和分析問題解決方面的能力,特別是在需要精細逐步推理的領域。
效能基準測試
QVQ-72B-Preview 在視覺推理方面相較於其前身 Qwen2-VL-72B-Instruct 展現了顯著的提升。該模型在四個主要數據集上進行了評估:
- MMMU: 一個大學級別的多學科多模態評估數據集。QVQ-72B-Preview 取得了 70.3 分,顯著領先於 Qwen2-VL-72B-Instruct。
- MathVista: 一個專注於數學的視覺推理測試集,涵蓋拼圖圖形、函數圖形和學術圖表。
- MathVision: 一個源自真實數學競賽的多模態數學推理測試集。
- OlympiadBench: 一個雙語多模態科學基準,包含來自奧林匹克數學和物理競賽的 8,476 題問題,包括中國大學入學考試。
在數學和科學基準測試中,QVQ-72B-Preview 有效地縮小了與最先進的 o1 模型的性能差距。
技術能力與推理過程
QVQ-72B-Preview 採用有條理的逐步推理方法來解決複雜的視覺任務。示例案例展示了其處理各種技術挑戰的能力:
- Mathematics: 模型可以應用導數的乘法法則來解決基於表格的微積分問題,並使用圓公式來評估繪製函數的積分。
- Physical Volume Calculation: 模型可以將複雜的 L 形物體分解為長方體,並考慮重疊體積來計算總體積。
- Chemistry: 模型可以分析化學流程圖(例如,從黃銅礦提取銅)來根據反應序列識別特定化學物質。
- Biology: 模型可以分析遺傳圖表,通過評估等位基因遺傳來確定染色體異常的原因,例如 Klinefelter 綜合症。
- Geometry: 模型可以使用座標幾何和線性方程來計算隨機點落在矩形內特定三角形的概率。
模型限制
作為一個實驗性研究模型,QVQ-72B-Preview 具有若干已知限制:
- Language and Logic: 模型可能會出現意外的語言混合、代碼切換,或陷入遞歸推理模式(循環邏輯),產出冗長但未得到結論的回應。
- Reliability: 在多步驟視覺推理過程中,模型可能會失去對圖像內容的關注,這可能導致幻覺。
- Functional Scope: 它並非旨在完全取代 Qwen2-VL-72B-Instruct 的能力。
- Safety: 模型需要加強安全措施以實現安全部署。
未來發展
Qwen 旨在將 QVQ 發展為一個