SkyworkAI/Skywork-R1V

Skywork-R1V is an advanced multimodal AI model series developed by Skywork AI, specializing in vision-language reasoning.

解決的問題

Skywork-R1V 提供了一個高性能的開源多模態推理模型,旨在彌合視覺感知與複雜邏輯推理之間的鴻溝。它專門解決了需要 AI 利用視覺輸入在數學、物理與通用邏輯等多元學科中進行高級推理的需求。

工作原理

該專案在訓練後階段利用強化學習(RL)演算法來增強模型的多模態推理能力。它實現了視覺思維鏈(CoT)方法,允許模型將複雜的視覺問題分解為邏輯步驟。最新版本 Skywork-R1V3-38B 是基於 InternVL3-38B 基礎模型構建的。

適用對象

該模型面向從事多模態 AI 研究的研究人員與開發人員,特別是那些在視覺推理、圖像數學問題解決與複雜邏輯分析方面需要最先進性能的人員。

亮點

  • SOTA 性能:在包括 MMMU (76.0)、MathVista 與 PhyX 在內的多個基準測試中實現了最先進的結果。
  • 視覺思維鏈:專為高級視覺邏輯推理而設計。
  • 靈活部署:支援透過 Transformers 函式庫與 vLLM 進行推理。
  • 量化支援:提供 AWQ 量化版本,以便在顯存大於 30GB 的單一 GPU 上進行推理。