Skywork-R1V: 高度な視覚的チェーン・オブ・ソート能力と複雑ベンチマークにおけるSOTA性能を備えたマルチモーダル推論モデル
解決する課題
Skywork-R1Vは、視覚的認識と複雑な論理推論のギャップを埋めることを目的とした、高性能なオープンソースのマルチモーダル推論モデルを提供します。特に、数学、物理、一般的な論理など多様な分野にわたって、視覚入力を用いた高度な推論を実行できるAIのニーズに対応しています。
動作原理
本プロジェクトは、ポストトレーニング時に強化学習(RL)アルゴリズムを活用して、モデルのマルチモーダル推論能力を向上させます。視覚的チェーン・オブ・ソート(CoT)アプローチを実装し、複雑な視覚問題を論理的なステップに分解できるようにします。最新バージョンの Skywork-R1V3-38B は、InternVL3-38B ベースモデル上に構築されています。
対象ユーザー
このモデルは、マルチモーダルAIに取り組む研究者や開発者を対象としており、特に視覚的推論、画像からの数学的問題解決、複雑な論理分析において最先端の性能が求められる方々に適しています。
ハイライト
- SOTA Performance: MMMU(76.0)、MathVista、PhyX など複数のベンチマークで最先端の結果を達成。
- Visual Chain-of-Thought: 高度な視覚的論理推論のために特別に設計されています。
- Flexible Deployment: Transformers ライブラリと vLLM の両方を使用した推論をサポート。
- Quantization Support: 30GB 超の VRAM を搭載した単一 GPU でも推論可能な AWQ 量子化バージョンを提供。