QVQ-Max 視覺推理模型發布
Qwen 正式發布了 QVQ-Max,一款旨在超越簡單圖像理解,進行主動分析與問題解決的視覺推理模型。QVQ-Max 結合視覺感知與深度推理,能夠解決從複雜數學問題到創意內容生成等各類任務。
擴展思考過程以提升數學準確度
QVQ-Max 展示了其內部思考過程長度與在 MathVision 基準測試上準確度之間的直接相關性。透過調整模型思考過程的最大長度,Qwen 觀察到準確度持續提升,顯示模型的推理能力會隨著分配給「思考」的計算資源而擴展。
核心技術能力
QVQ-Max 被設計為一位同時具備「銳眼」與「快思」的助理,聚焦於三個主要功能領域:
詳細觀察
QVQ-Max 解析複雜的視覺輸入,包括圖表與日常快照,以辨識關鍵要素、文字標籤以及標準模型可能忽略的細微細節。
深度推理
模型將視覺觀察與背景知識結合,以推導結論。這包括根據圖示解決幾何問題,以及根據當前場景預測影片剪輯中的未來事件。
靈活應用
除了分析之外,QVQ-Max 將其推理應用於創意與實務任務,例如:
- 將粗略草圖精練成完整插圖。
- 生成短影片腳本。
- 創作角色扮演內容。
- 對上傳的照片提供評論或詮釋。
實務應用情境
QVQ-Max 設計用於三大領域的實用性:
- 工作場所:協助資料分析、資訊整理與程式碼生成。
- 教育:解決依賴圖示的複雜數學與物理問題,並直觀說明精細概念。
- 日常生活:提供實用建議,例如根據衣櫥照片推薦服裝搭配,或依據圖像指導使用者烹飪食譜。
未來發展路線圖
Qwen 已確定 QVQ-Max 未來演進的三個主要方向:
- 提升觀察精準度:實施 grounding 技術以驗證視覺觀察。
- 視覺代理能力:增強模型執行多步驟複雜任務的能力,包括操作電腦、智慧型手機與玩遊戲。
- 多模態互動:將互動範圍擴展至文字之外,涵蓋工具驗證與視覺生成。
Sources
- OriginalQVQ-Max: Think with Evidence