SkyworkAI/Skywork-R1V

Skywork-R1V is an advanced multimodal AI model series developed by Skywork AI, specializing in vision-language reasoning.

해결하는 문제

Skywork-R1V는 시각적 지각과 복잡한 논리적 추론 사이의 간극을 메우기 위해 설계된 고성능 오픈 소스 멀티모달 추론 모델을 제공합니다. 이는 시각적 입력을 사용하여 수학, 물리 및 일반 논리를 포함한 다양한 분야에서 고급 추론을 수행할 수 있는 AI에 대한 요구를 구체적으로 해결합니다.

작동 원리

이 프로젝트는 포스트 트레이닝 중에 강화 학습(RL) 알고리즘을 활용하여 모델의 멀티모달 추론 능력을 향상시킵니다. 시각적 사고의 연쇄(CoT) 방식을 구현하여 모델이 복잡한 시각적 문제를 논리적 단계로 분해할 수 있도록 합니다. 최신 버전인 Skywork-R1V3-38B는 InternVL3-38B 베이스 모델을 기반으로 구축되었습니다.

대상 사용자

이 모델은 멀티모달 AI를 연구하는 연구자와 개발자, 특히 시각적 추론, 이미지 기반 수학 문제 해결 및 복잡한 논리 분석에서 최첨단 성능이 필요한 분들을 대상으로 합니다.

주요 특징

  • SOTA 성능: MMMU (76.0), MathVista, PhyX를 포함한 여러 벤치마크에서 최첨단 결과를 달성했습니다.
  • 시각적 사고의 연쇄: 고급 시각적 논리 추론을 위해 특별히 설계되었습니다.
  • 유연한 배포: Transformers 라이브러리와 vLLM 모두를 통한 추론을 지원합니다.
  • 양자화 지원: 30GB 이상의 VRAM을 가진 단일 GPU에서 추론을 가능하게 하는 AWQ 양자화 버전을 제공합니다.