SkyworkAI/Skywork-R1V

Skywork-R1V is an advanced multimodal AI model series developed by Skywork AI, specializing in vision-language reasoning.

解决的问题

Skywork-R1V 提供了一个高性能的开源多模态推理模型,旨在弥合视觉感知与复杂逻辑推理之间的鸿沟。它专门解决了需要 AI 利用视觉输入在数学、物理和通用逻辑等多种学科中进行高级推理的需求。

工作原理

该项目在训练后阶段利用强化学习(RL)算法来增强模型的多模态推理能力。它实现了视觉思维链(CoT)方法,允许模型将复杂的视觉问题分解为逻辑步骤。最新版本 Skywork-R1V3-38B 是基于 InternVL3-38B 基础模型构建的。

适用对象

该模型面向从事多模态 AI 研究的研究人员和开发人员,特别是那些在视觉推理、图像数学问题解决和复杂逻辑分析方面需要最先进性能的人员。

亮点

  • SOTA 性能:在包括 MMMU (76.0)、MathVista 和 PhyX 在内的多个基准测试中实现了最先进的结果。
  • 视觉思维链:专为高级视觉逻辑推理而设计。
  • 灵活部署:支持通过 Transformers 库和 vLLM 进行推理。
  • 量化支持:提供 AWQ 量化版本,以便在显存大于 30GB 的单 GPU 上进行推理。