QVQ-Max 視覺推理模型發布

Qwen 正式發布了 QVQ-Max,一款旨在超越簡單圖像理解,進行主動分析與問題解決的視覺推理模型。QVQ-Max 結合視覺感知與深度推理,能夠解決從複雜數學問題到創意內容生成等各類任務。

擴展思考過程以提升數學準確度

QVQ-Max 展示了其內部思考過程長度與在 MathVision 基準測試上準確度之間的直接相關性。透過調整模型思考過程的最大長度,Qwen 觀察到準確度持續提升,顯示模型的推理能力會隨著分配給「思考」的計算資源而擴展。

核心技術能力

QVQ-Max 被設計為一位同時具備「銳眼」與「快思」的助理,聚焦於三個主要功能領域:

詳細觀察

QVQ-Max 解析複雜的視覺輸入,包括圖表與日常快照,以辨識關鍵要素、文字標籤以及標準模型可能忽略的細微細節。

深度推理

模型將視覺觀察與背景知識結合,以推導結論。這包括根據圖示解決幾何問題,以及根據當前場景預測影片剪輯中的未來事件。

靈活應用

除了分析之外,QVQ-Max 將其推理應用於創意與實務任務,例如:

  • 將粗略草圖精練成完整插圖。
  • 生成短影片腳本。
  • 創作角色扮演內容。
  • 對上傳的照片提供評論或詮釋。

實務應用情境

QVQ-Max 設計用於三大領域的實用性:

  • 工作場所:協助資料分析、資訊整理與程式碼生成。
  • 教育:解決依賴圖示的複雜數學與物理問題,並直觀說明精細概念。
  • 日常生活:提供實用建議,例如根據衣櫥照片推薦服裝搭配,或依據圖像指導使用者烹飪食譜。

未來發展路線圖

Qwen 已確定 QVQ-Max 未來演進的三個主要方向:

  1. 提升觀察精準度:實施 grounding 技術以驗證視覺觀察。
  2. 視覺代理能力:增強模型執行多步驟複雜任務的能力,包括操作電腦、智慧型手機與玩遊戲。
  3. 多模態互動:將互動範圍擴展至文字之外,涵蓋工具驗證與視覺生成。

Sources