TIGER-AI-Lab/VLM2Vec
This repo contains the code for "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], and "MMEB-V3" [COLM 2026]
해결하는 문제
VLM2Vec는 다양한 데이터 유형에 대해 강력한 고정 차원 임베딩을 생성하기 위한 통합 프레임워크를 제공합니다. 이는 텍스트, 이미지, 비디오, 오디오, 시각적 문서 및 에이전트 중심 데이터(GUI 요소 및 도구 검색 등)를 공유된 임베딩 공간 내에서 처리할 수 있는 단일 모델을 만드는 문제를 해결합니다.
작동 방식
이 프로젝트는 지시 가이드 기반의 대조 학습을 사용하여 Qwen2-VL과 같은 최첨단 시각-언어 모델(VLM)을 미세 조정합니다. 이를 통해 모델은 모든 입력 조합에 대해 단일 임베딩 벡터를 생성할 수 있어, 서로 다른 모달리티 간의 효율적인 검색 및 분류가 가능해집니다.
대상
이 프로젝트는 다양한 입력에 대해 공유된 의미 공간이 필요한 멀티모달 검색 시스템, 교차 모달 검색 엔진 및 AI 에이전트를 구축하는 연구자와 개발자를 위해 설계되었습니다.
주요 특징
- 전 모달리티 지원: 텍스트, 이미지, 비디오, 오디오, 시각적 문서 및 에이전트 중심 작업을 지원합니다.
- MMEB 벤치마크: 모달리티 간의 성능 격차를 측정하기 위해 190개의 태스크를 포함하는 포괄적인 평가 스위트(MMEB-V3)를 포함합니다.
- OmniSET: 서로 다른 모달리티 간의 의미적으로 동일한 인스턴스를 그룹화하여 모달리티 효과를 분석하는 진단 도구입니다.
- 통합 프레임워크: 다양한 시각적 및 청각적 형식에 걸쳐 임베딩 모델을 학습하고 평가하기 위한 단일 코드베이스입니다.