AIGeeksGroup/3D-R1
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
解決的問題
3D-R1 解決了當前 3D 視覺-語言模型(VLM)所面臨的限制,這些模型由於缺乏高品質的空間資料與靜態視角假設,常在穩健推理與泛化能力上表現不佳。它旨在提供一種統一的 3D 場景理解方法,涵蓋密集描述、視覺定位、3D 問答等任務。
工作原理
3D-R1 採用多階段訓練與架構方法:
- 冷啟動初始化: 使用 Scene-30K 這項高品質合成資料集,該資料集基於 Gemini 2.5 Pro 建構的資料引擎生成,包含 Chain-of-Thought(CoT)推理。
- 強化學習(RL): 透過 GRPO 等 RLHF 策略進一步優化模型。利用三種特定獎勵函數——感知獎勵、語義相似性獎勵與格式獎勵——確保檢測準確性與語義精確性。
- 動態視角選擇: 不依賴靜態視角,而是自適應地選擇最能提供資訊的視角來理解 3D 場景。
- 骨幹網路: 採用 Qwen2.5-VL-7B-Instruct 模型作為基礎大語言模型(LLM)。
適用對象
本專案專為從事 3D 電腦視覺、空間人工智慧以及大語言模型與 3D 場景感知整合的研究人員與開發者設計。
主要亮點
- 統一的場景理解: 能夠處理 3D-DC(密集描述)、3D-VG(視覺定位)、3D-QA(問答)、3D 對話、3D 推理與 3D 規劃等任務。
- 合成 CoT 資料: 引入 Scene-30K,以彌補高品質 3D 空間推理資料的缺口。
- RL 增強推理: 使用 GRPO 與專用獎勵函數提升推理能力。
- 零樣本泛化: 在無需任務特定訓練的情況下,對複雜場景表現出強大性能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案