om-ai-lab/VLM-FO1
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
해결하는 문제
기존의 Vision-Language Models (VLMs)는 일반적인 고수준 추론 능력을 유지하면서 세밀한 인지(이미지 내의 작거나 특정된 세부 사항을 정확하게 위치시키고 이해하는 능력)를 수행하는 데 어려움을 겪는 경우가 많습니다. VLM-FO1은 사전 학습된 모델의 일반적인 지식을 삭제하지 않고 정확한 공간 인식을 추가함으로써 이 격차를 해소합니다.
작동 원리
VLM-FO1은 기존의 모든 VLM과 통합할 수 있는 플러그 앤 플레이 모듈입니다. 이 모듈은 의미가 풍부한 특징과 인지 기능이 강화된 특징을 혼합하는 Dual-Vision Encoder 아키텍처를 갖춘 Hybrid Region Encoder (HFRE)를 사용합니다. 이를 통해 특정 영역의 전체적인 의미와 세밀한 공간적 세부 사항을 모두 캡처하는 "region tokens"를 생성합니다. 모델이 원래의 일반적인 능력을 잊어버리는 것을 방지하기 위해 2단계 훈련 전략을 채택합니다.
대상
객체 접지(object grounding), 영역 기반 추론 및 정확한 객체 계수와 같은 작업을 수행해야 하는 인지 인식 AI 모델을 구축하는 연구자 및 개발자를 위해 설계되었습니다.
주요 특징
- 플러그 앤 플레이: 원래의 가중치를 변경하지 않고도 모든 사전 학습된 VLM에 추가할 수 있습니다.
- 세밀한 작업: 객체 접지, 영역 생성 이해 및 시각적 영역 추론에 탁월합니다.
- 유연한 통합: 고정밀 탐지 및 비디오 추적을 위해 UPN과 같은 외부 객체 탐지기 또는 SAM3와 같은 세그멘테이션 도구와 함께 작동합니다。
- 지식 보존: 베이스 모델의 일반적인 시각적 이해에 대한 "파괴적 망각"을 피하도록 특별히 훈련되었습니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트