AIGeeksGroup/3D-R1
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
何を解決するか
3D-R1は、現在の3Dビジョン言語モデル(VLM)が高品質な空間データの不足や固定視点の仮定により、堅牢な推論と一般化に課題を抱えている点に取り組みます。3Dシーン理解の統一的アプローチを提供することを目指しており、密なキャプション、視覚的接地、3D質問応答などのタスクを含みます。
仕組み
3D-R1は段階的なトレーニングとアーキテクチャアプローチを採用しています:
- コールドスタート初期化: Gemini 2.5 Proを基盤とするデータエンジンで生成されたChain-of-Thought(CoT)推論を備えた高品質な合成データセット「Scene-30K」を使用。
- 強化学習(RL): GRPOなどのRLHFポリシーを用いてモデルをさらに最適化。検出精度と意味的正確性を確保するため、3つの特定の報酬関数(認識、意味的類似度、フォーマット報酬)を活用。
- 動的視点選択: 固定視点に依存せず、3Dシーンを理解する上で最も情報量の多い視点を適応的に選択。
- バックボーン: 基盤となるLLMとして、Qwen2.5-VL-7B-Instructモデルを採用。
対象ユーザー
本プロジェクトは、3Dコンピュータビジョン、空間AI、および大規模言語モデルと3Dシーン認識の統合に取り組む研究者や開発者を対象としています。
主な特徴
- 統一されたシーン理解: 3D-DC(密なキャプション)、3D-VG(視覚的接地)、3D-QA(質問応答)、3Dダイアログ、3D推論、3D計画に対応可能。
- 合成CoTデータ: 高品質な3D空間推論データの不足を埋めるために「Scene-30K」を導入。
- RL強化推論: GRPOと専用報酬関数を用いて推論能力を向上。
- ゼロショット一般化: タスク固有のトレーニングなしで複雑なシーンにおいても優れた性能を発揮。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト