lxtGH/OMG-Seg

Official Repo For OMG-LLaVA and OMG-Seg codebase [CVPR-24 and NeurIPS-24]

What it solves

OMG-Seg와 OMG-LLaVA는 다양한 범위의 시각적 지각 및 추론 작업을 수행할 수 있는 단일 통합 모델을 통해 여러 전문화된 비전 모델을 대체하고자 합니다. LLM을 사용하여 별도의 전문화된 모델을 조율하는 대신, 이 프레임워크워크는 픽셀 수준의 이해와 추론을 위한 엔드투엔드 솔루션을 제공합니다.

How it works

  • OMG-Seg: Transformer-based 인코더-디코더 아키텍처로, 태스크-특정(task-specific) 쿼리를 사용하여 10가지 이상의 서로 다른 세그멘테이션 세그멘테이션 세그멘테이션 세그멘테이션 세그멘테이션 세-

  • OMG-LLaVA: 범용 세그멘테이션 방법을 시각적 인코더로 사용하여 LLM과 결 unação

Who it's for

컴퓨터 비전 및 멀티모달 LLM에 집중하는 연구자 및 학술 연구실, 특히 밀도 높은 예측 작업에 대한 계산 오버헤드를 줄이고 모델 아키텍처를 단순화하는 데 관심이 있는 연구자들입니다.

Highlights

  • Unified Architecture: 여러 밀도 높은 예측 작업에 대해 한 번에 공동 학습을 지원합니다.

  • Universal Segmentation: OMG-Seg는 이미지, 비디오, 및 오픈보캐블러리 세그멘테이션을 단일 모델 내에서 처리합니다.

  • Efficiency: OMG-Seg는 70M의 학습 가능한 파라미터만 사용하며, 32GB V100 또는 40GB A100 GPU 하나로 재현할 수 있습니다.

  • End-to-End: 이미지 수준, 객체 수준, 및 픽셀 수준의 추론을 단일 코드베이스에서 연결합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트