om-ai-lab/VLM-R1
Solve Visual Understanding with Reinforced VLMs
What it solves
VLM-R1은 시각 작업에서 추론할 수 있는 안정적이고 일반화 가능한 대형 비전-언어 모델(LVLM)을 만드는 문제를 해결합니다. 특히 지시 표현 이해(REC), 오픈 보카블러리 탐지(OVD), 멀티모달 수학 등 전통적인 감독식 미세조정(SFT)으로는 일반화가 어려운 도메인 외 데이터에 대한 성능 향상을 목표로 합니다.
How it works
이 프로젝트는 "R1 스타일" 훈련 방식을 구현하며, 주로 Group Relative Policy Optimization(GRPO)을 사용해 Qwen2.5-VL 및 InternVL과 같은 모델을 훈련합니다. 특정 라벨을 모방하는 SFT와 달리, GRPO는 보상 기반 학습을 통해 모델이 추론 능력을 개발하도록 합니다. 시스템은 전체 파인튜닝, LoRA 및 다중 노드 훈련을 지원하며, 단일 이미지와 다중 이미지 입력을 모두 처리해 복잡한 그라운딩 및 추론 작업을 해결합니다.
Who it’s for
이 프로젝트는 멀티모달 추론, 객체 탐지 및 시각적 그라운딩에 종사하는 AI 연구자와 개발자를 위한 것으로, 비전-언어 모델에 강화 학습(특히 GRPO)을 적용해 더 나은 일반화 성능을 달성하고자 하는 분들에게 적합합니다.
Highlights
- State-of-the-Art Performance: Achieves top results on the Open-Compass Math Leaderboard (under 4B parameters) and SOTA performance on OVDEval.
- Versatile Task Support: Specialized models available for Open-Vocabulary Detection (OVD), Multi-Modal Math, Referring Expression Comprehension (REC), and GUI Defect Detection.
- Flexible Training: Supports LoRA, full fine-tuning, and multi-node training across various VLMs including QwenVL and InternVL.
- Hardware Optimization: Optimized for Huawei Ascend Atlas series using vllm-ascend and xllm frameworks for reduced TTFT and increased throughput.