Tencent/WeMM-Embedding

WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

해결하는 문제

WeMM-Embedding은 텍스트, 이미지, 비디오, 시각 문서와 같은 다양한 유형의 데이터를 수학적 벡터(임베딩)로 통합적으로 표현할 필요성을 해결합니다. 이를 통해 다양한 멀티모달 입력을 단일 공유 공간 내에서 비교하거나 검색할 수 있게 되어, 다양한 미디어 유형 간 고성능 검색 및 분석이 가능해집니다.

작동 방식

2B, 4B, 9B 파라미터 크기로 제공되는 멀티모달 임베딩 모델의 패밀리입니다. 다양한 입력을 처리하고 특정 <embedding> 토큰에서 마지막 레이어의 은닉 상태로부터 표현을 생성합니다. 모델은 마트료시카 임베딩을 사용하여, 벡터를 더 작은 차원(예: 2048에서 256로)으로 자르더라도 원래 성능의 대부분을 유지할 수 있으며, 저장 및 계산 비용을 줄일 수 있습니다.

대상 사용자

멀티모달 검색 엔진, 검색 기반 생성(RAG) 시스템, 또는 텍스트, 이미지, 비디오를 통합 벡터 공간에서 비교해야 하는 모든 애플리케이션을 개발하는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 유니버설 모달리티 지원: 텍스트, 이미지, 비디오, 시각 문서, 그리고 혼합된 멀티모달 입력을 처리합니다.
  • 유연한 차원: 정확도의 큰 손실 없이 조정 가능한 벡터 크기를 지원하는 마트료시카 임베딩을 제공합니다.
  • 고성능: 이미지, 비디오, 시각 문서 작업에서 MMEB-v2 및 MMEB-v3 벤치마크에서 최고 수준의 성능을 달성합니다.
  • 배포 준비 완료: vLLM, SGLang, Sentence Transformers와 같은 인기 있는 추론 프레임워크와 호환됩니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트