FlagOpen/FlagEmbedding
Retrieval and Retrieval-augmented LLMs
What it solves
BGE (BAAI General Embedding)는 검색 증강 생성 (RAG) 및 검색 시스템의 검색 단계를 개선하기 위한 포괄적인 툴킷을 제공합니다. 텍스트, 이미지 및 다국어 콘텐츠를 정확하게 벡터 표현(embeddings)으로 매핑하는 과제를 해결하여, 대규모 데이터셋에서 관련 정보를 효율적으로 검색할 수 있도록 합니다.
How it works
BGE는 전체 검색 파이프라인을 위한 일련의 모델과 도구를 제공합니다:
- Embedders: 텍스트 또는 이미지를 벡터로 변환하는 모델입니다. 여기에는 BGE-M3 (밀집, 어휘 및 다중 벡터 검색 지원) 및 멀티모달 시각적 검색을 위한 BGE-VL과 같은 전문화된 모델이 포함됩니다.
- Rerankers: 초기 검색 결과를 정교화하여 상위 k개의 문서에 대해 더 정확한 순위를 제공하는 크로스 인코더(Cross-encoder) 모델입니다.
- Finetuning: 이러한 모델을 특정 도메인이나 작업에 적응시키기 위한 도구로, 하드 네거티브(hard negatives) 마이닝 및 지침 추가를 위한 스크립트가 포함됩니다.
- Evaluation: 검색 및 순위 모델의 성능을 측정하기 위한 프레임워크입니다.
Who it’s for
이 툴킷은 검색 엔진, RAG 기반 LLM 애플리케이션, 그리고 다양한 언어와 모달리티에 걸쳐 고성능 시맨틱 검색이 필요한 멀티모달 검색 시스템을 구축하는 개발자와 연구자를 위해 설계되었습니다.
Highlights
- Multimodal Support: 텍스트-이미지 및 이미지-텍스트 검색을 위한 BGE-VL을 포함합니다.
- Versatile Retrieval: BGE-M3는 단일 모델에서 밀집(dense), 희소(sparse, 어휘) 및 다중 벡터(ColBERT) 검색을 지원합니다.
- Multilingual Capabilities: 100개 이상의 언어를 광범위하게 지원합니다.
- Comprehensive Pipeline: 추론, 미세 조정, 평가 및 데이터셋 관리를 아우르는 "원스톱" 솔루션을 제공합니다.