SkyworkAI/Skywork-R1V

Skywork-R1V is an advanced multimodal AI model series developed by Skywork AI, specializing in vision-language reasoning.

解決する課題

Skywork-R1Vは、視覚的知覚と複雑な論理推論の間のギャップを埋めるために設計された、高性能なオープンソースのマルチモーダル推論モデルを提供します。これは、視覚的入力を利用して、数学、物理学、一般的な論理を含む多様な分野で高度な推論を実行できるAIへのニーズに特化して対応しています。

仕組み

このプロジェクトは、ポストトレーニング中に強化学習(RL)アルゴリズムを利用して、モデルのマルチモーダル推論能力を強化します。視覚的思考の連鎖(CoT)アプローチを実装しており、モデルが複雑な視覚的問題を論理的なステップに分解できるようにします。最新バージョンである Skywork-R1V3-38B は、InternVL3-38B ベースモデルに基づいて構築されています。

対象者

このモデルは、マルチモーダルAIに取り組んでいる研究者や開発者、特に視覚的推論、画像からの数学的問題解決、および複雑な論理分析において最先端の性能を必要とする方を対象としています。

ハイライト

  • SOTA性能: MMMU (76.0)、MathVista、PhyX を含む複数のベンチマークで最先端の結果を達成しています。
  • 視覚的思考の連鎖: 高度な視覚的論理推論のために特別に設計されています。
  • 柔軟なデプロイ: Transformers ライブラリと vLLM の両方による推論をサポートしています。
  • 量子化サポート: 30GB 以上の VRAM を持つシングル GPU での推論を可能にする AWQ 量子化バージョンを提供しています。