facebookresearch/VLM3

Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".

해결하는 문제

VLM³은 3D 비전 작업의 복잡성을 해결합니다. 기존에는 3D 이해에서 높은 성능을 얻기 위해 특수한 아키텍처, 복잡한 손실 함수, 그리고 광범위한 데이터 증강이 필요했습니다. VLM³은 특수한 추가 요소 없이도 표준 비전 언어 모델(VLM)이 이러한 작업을 효과적으로 수행할 수 있음을 보여줍니다.

작동 방식

이 프로젝트는 표준 VLM 아키텍처(특히 Qwen3-vl-4B 기반)를 사용하고, 통합된 텍스트 기반 출력 도메인에서 감독 미세조정(SFT)을 통해 훈련합니다. 3D 작업을 처리하기 위해 두 가지 핵심 기술을 활용합니다:

  1. 초점 거리 정규화: 입력 이미지를 리사이징하여 모든 이미지에서 초점 거리가 일관되게 유지되며, 추가 인코더 없이 카메라의 모호성을 제거합니다.
  2. 정규화된 좌표 참조: 모델은 객체나 픽셀을 텍스트 기반 정규화된 좌표([0, 2000) 또는 [0, 1000))로 참조하여 마커 렌더링이나 아키텍처 변경 없이도 작동합니다.

대상 사용자

3D 비전, 깊이 추정, 카메라 자세 추정 작업에 종사하는 연구자 및 개발자에게 적합합니다. 기초 모델을 활용한 3D 학습의 확장성과 단순성을 원하는 분들께 추천합니다.

주요 특징

  • 아키텍처 변경 없음: 커스텀 예측 헤드나 라우팅이 필요 없으며, 표준 VLM 아키텍처와 손실 함수로 작동합니다.
  • 높은 성능: 메트릭 깊이 추정, 픽셀 대응, 카메라 자세 추정에서 최첨단 모델과 동등하거나 이를 초월하는 성능을 달성합니다.
  • 간소화된 파이프라인: 회전, 이동, 외관 증강과 같은 복잡한 데이터 증강이 필요 없습니다.
  • 통합된 출력: 3D 공간 추론을 위한 간단한 텍스트 기반 출력을 사용합니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch