lxtGH/OMG-Seg
Official Repo For OMG-LLaVA and OMG-Seg codebase [CVPR-24 and NeurIPS-24]
What it solves
OMG-Seg와 OMG-LLaVA는 다양한 범위의 시각적 지각 및 추론 작업을 수행할 수 있는 단일 통합 모델을 통해 여러 전문화된 비전 모델을 대체하고자 합니다. LLM을 사용하여 별도의 전문화된 모델을 조율하는 대신, 이 프레임워크워크는 픽셀 수준의 이해와 추론을 위한 엔드투엔드 솔루션을 제공합니다.
How it works
OMG-Seg: Transformer-based 인코더-디코더 아키텍처로, 태스크-특정(task-specific) 쿼리를 사용하여 10가지 이상의 서로 다른 세그멘테이션 세그멘테이션 세그멘테이션 세그멘테이션 세그멘테이션 세-
OMG-LLaVA: 범용 세그멘테이션 방법을 시각적 인코더로 사용하여 LLM과 결 unação
Who it's for
컴퓨터 비전 및 멀티모달 LLM에 집중하는 연구자 및 학술 연구실, 특히 밀도 높은 예측 작업에 대한 계산 오버헤드를 줄이고 모델 아키텍처를 단순화하는 데 관심이 있는 연구자들입니다.
Highlights
Unified Architecture: 여러 밀도 높은 예측 작업에 대해 한 번에 공동 학습을 지원합니다.
Universal Segmentation: OMG-Seg는 이미지, 비디오, 및 오픈보캐블러리 세그멘테이션을 단일 모델 내에서 처리합니다.
Efficiency: OMG-Seg는 70M의 학습 가능한 파라미터만 사용하며, 32GB V100 또는 40GB A100 GPU 하나로 재현할 수 있습니다.
End-to-End: 이미지 수준, 객체 수준, 및 픽셀 수준의 추론을 단일 코드베이스에서 연결합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트