FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

해결하는 문제

BGE (BAAI General Embedding)는 Retrieval-Augmented Generation (RAG) 및 검색 시스템의 검색 단계를 개선하기 위한 포괄적인 툴킷을 제공합니다. LLM이 처리할 수 있도록 가장 관련성이 높은 문서를 검색하기 위해 고품질의 텍스트 및 멀티모달 임베딩 및 리랭킹 모델의 필요성을 해결합니다.

작동 방식

이 툴킷은 전체 검색 파이프라인을 위한 일련의 모델과 도구를 제공합니다:

  • Embedding Models: 텍스트 또는 이미지를 벡터(임베딩)로 변환하여 효율적인 유사도 검색을 수행합니다. 여기에는 다국어, 다중 그래뉼러리티(multi-granular), 다기능 검색(dense, lexical, multi-vector)을 위한 BGE-M3와 같은 특화된 모델이 포함됩니다.
  • Rerankers: 임베딩 모델이 반환한 상위 k개 문서에 대해 더 정확하지만 속도가 느린 점수를 제공하여 검색 결과를 정교화하는 교차 인코더(Cross-encoder) 모델입니다.
  • Multimodal Capabilities: BGE-VL은 텍스트-to-이미지 및 이미지-to-텍스트 검색을 포함한 시각적 검색 애플리케이션을 지원합니다.
  • Fine-tuning & Evaluation: 커스텀 데이터로 임베더와 리랭커를 미세 조정하고 C-MTEB와 같은 벤치마크를 사용하여 성능을 평가하는 도구가 포함되어 있습니다.

대상 사용자

이 프로젝트는 최첨단 임베딩 및 리랭킹 기능이 필요한 RAG 기반 애플리케이션, 검색 엔진 및 멀티모달 검색 시스템을 구축하는 개발자와 연구원을 위한 것입니다.

주요 특징

  • BGE-M3: 100개 이상의 언어, 최대 8192 토큰의 입력 길이 및 3가지 검색 방법(dense, lexical, multi-vector)을 지원하는 다재다능한 모델.
  • Multimodal Support: 포괄적인 시각적 검색을 위한 BGE-VL 및 하이브리드 이미지-텍스트 데이터를 위한 Visualized-BGE 포함.
  • Comprehensive Toolkit: 임베더와 리랭커 모두에 대한 추론, 미세 조정 및 평가를 위한 원스톱 솔루션 제공.
  • High Performance: 시리즈의 많은 모델이 MTEB 및 C-MTEB와 같은 벤치마크에서 높은 순위를 차지하고 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트