om-ai-lab/VLM-R1
Solve Visual Understanding with Reinforced VLMs
What it solves
VLM-R1 は、視覚タスクで推論できる安定かつ汎化可能な大規模ビジョン・言語モデル(LVLM)を作成する課題に取り組みます。特に、指示表現理解(REC)、オープンボキャブラリ検出(OVD)、マルチモーダル数学などのタスクに対し、従来の教師あり微調整(SFT)では汎化が難しい領域外データでの性能向上を目指します。
How it works
本プロジェクトは「R1 スタイル」訓練アプローチを実装し、主に Group Relative Policy Optimization(GRPO)を用いて Qwen2.5-VL や InternVL といったモデルを訓練します。特定ラベルを模倣する SFT とは異なり、GRPO は報酬ベースの学習を通じてモデルに推論能力を育成させます。システムはフルファインチューニング、LoRA、マルチノード訓練をサポートし、単一画像および複数画像入力の両方に対応して複雑なグラウンディング・推論タスクを解決します。
Who it’s for
このプロジェクトは、マルチモーダル推論、物体検出、視覚的グラウンディングに取り組む AI 研究者や開発者向けです。ビジョン・言語モデルに対して強化学習(特に GRPO)を実装し、より高い汎化性能を実現したい方に最適です。
Highlights
- State-of-the-Art Performance: Achieves top results on the Open-Compass Math Leaderboard (under 4B parameters) and SOTA performance on OVDEval.
- Versatile Task Support: Specialized models available for Open-Vocabulary Detection (OVD), Multi-Modal Math, Referring Expression Comprehension (REC), and GUI Defect Detection.
- Flexible Training: Supports LoRA, full fine-tuning, and multi-node training across various VLMs including QwenVL and InternVL.
- Hardware Optimization: Optimized for Huawei Ascend Atlas series using vllm-ascend and xllm frameworks for reduced TTFT and increased throughput.