Qwen2.5-VL-32B リリースノート
Qwenは、Qwen2.5-VL-32B-Instruct をリリースしました。この視覚言語(VL)モデルは、強化学習を活用して数学的推論と画像理解を向上させます。モデルは Apache 2.0 ライセンスの下でオープンソース化されています。
主な改善点と機能
Qwen2.5-VL-32B-Instruct は、従来の Qwen2.5-VL シリーズモデルに対して 3 つの主要な最適化を導入しています。
- Human Preference Alignment: 出力スタイルが調整され、より詳細でフォーマットが整った回答が提供され、人間の好みにより近く合わせられています。
- Enhanced Mathematical Reasoning: 複雑な数学問題を解く際の正確性が大幅に向上しています。
- Fine-grained Image Understanding: 画像のパース、コンテンツ認識、視覚的論理推論を伴うタスクにおいて、精度と詳細な分析が向上しています。
パフォーマンスベンチマーク
Qwen2.5-VL-32B-Instruct は、Mistral-Small-3.1-24B や Gemma-3-27B-IT などの同等モデルに対して優位性を示しています。特に、より大きな Qwen2-VL-72B-Instruct をいくつかの重要な領域で上回っています。
- Multimodal Reasoning: 複雑で多段階の推論に焦点を当てたベンチマーク、特に MMMU、MMMU-Pro、MathVista において、モデルは大きな優位性を示しています。
- User Experience: 主観的なユーザー体験を評価する MM-MT-Bench において、Qwen2.5-VL-32B-Instruct は Qwen2-VL-72B-Instruct を大幅に上回っています。
- Text Capabilities: 同規模の他モデルに比べ、純粋なテキスト能力でもトップクラスの性能を達成しています。
実践における視覚的推論
モデルの能力は、視覚データと論理・数学的ステップを統合する必要がある複雑な視覚タスクを通じて示されています。
- Visual Logic Deduction: 運転シナリオにおいて、モデルは速度制限標識(トラック用 100 km/h)を識別し、特定の距離(110 km)の移動時間を計算し、目的地に所定の時間までに到達できるかを結論付けることができます。
- Geometric Reasoning: 画像から交差する線や角の二等分線を分析し、特定の角度測定を計算することで、幾何学問題を解くことができます。
- Detailed Image Parsing: 画像内の特定の文化的マーカー(赤唐辛子と四川胡椒のベース、分割された鍋のデザインなど)を識別し、料理を四川麻辣火鍋として正しく特定することができます。
今後の研究方向
Qwen2.5-VL-32B は「高速思考」パラダイムを通じて主観的体験と数学的推論の最適化に焦点を当てていますが、Qwen チームは次の研究優先事項として 長く効果的な推論プロセス を掲げました。この方向性は、極めて複雑で多段階の視覚的推論タスクを解く際の視覚モデルの限界を拡げることを目指しています。