AIGeeksGroup/3D-R1
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
해결하는 문제
3D-R1은 현재 3D 비전-언어 모델(VLM)이 고품질 공간 데이터 부족과 고정된 시점 가정으로 인해 견고한 추론과 일반화에 어려움을 겪는 점을 해결합니다. 밀도 높은 캡션, 시각적 지문, 3D 질의응답과 같은 작업을 포함하는 통합적인 3D 장면 이해 접근을 제공하는 것을 목표로 합니다.
작동 방식
3D-R1은 다단계 훈련 및 아키텍처 접근 방식을 사용합니다:
- 콜드스타트 초기화: Gemini 2.5 Pro 기반의 데이터 엔진을 통해 생성된 Chain-of-Thought(CoT) 추론을 포함한 고품질 합성 데이터셋인 Scene-30K를 사용합니다.
- 강화학습(RL): GRPO와 같은 RLHF 정책을 사용하여 모델을 추가로 개선합니다. 탐지 정확도와 의미 정밀도를 보장하기 위해 인지, 의미 유사도, 형식 보상이라는 세 가지 특정 보상 함수를 활용합니다.
- 동적 시점 선택: 고정된 시점에 의존하지 않고, 3D 장면을 이해하는 데 가장 정보적인 시점을 적응적으로 선택합니다.
- 백본: 기반 LLM으로 Qwen2.5-VL-7B-Instruct 모델을 사용합니다.
대상 사용자
이 프로젝트는 3D 컴퓨터 비전, 공간 AI, 그리고 대규모 언어 모델과 3D 장면 인식의 통합에 종사하는 연구자 및 개발자를 대상으로 합니다.
주요 특징
- 통합된 장면 이해: 3D-DC(밀도 높은 캡션), 3D-VG(시각적 지문), 3D-QA(질의응답), 3D 대화, 3D 추론, 3D 계획을 처리할 수 있습니다.
- 합성 CoT 데이터: 고품질 3D 공간 추론 데이터의 부족을 메우기 위해 Scene-30K를 도입합니다.
- RL 기반 추론 강화: GRPO와 특화된 보상 함수를 사용하여 추론 능력을 향상시킵니다.
- 제로샷 일반화: 태스크별 훈련 없이도 복잡한 장면에서 우수한 성능을 보입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트