FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

What it solves

BGE (BAAI General Embedding) 提供了一个全面的工具包,用于改进检索增强生成 (RAG) 和搜索系统的检索阶段。它解决了如何将文本、图像和多语言内容准确地映射到向量表示 (embeddings) 中的挑战,以便从大型数据集中高效地检索相关信息。

How it works

BGE 为整个检索流程提供了一套模型和工具:

  • Embedders: 将文本或图像转换为向量的模型。这包括专门的模型,如 BGE-M3 (支持密集、词汇和多向量检索) 以及用于多模态视觉搜索的 BGE-VL。
  • Rerankers: 交叉编码器 (Cross-encoder) 模型,用于精炼初次检索的结果,以提供更准确的 top-k 文档的排名。
  • Finetuning: 用于将这些模型适配到特定领域或任务的工具,包括用于挖掘 hard negatives 和添加指令的脚本。
  • Evaluation: 用于衡量检索和排序模型性能的框架。

Who it’s for

该工具包是为开发者和研究人员设计的,旨在构建搜索引擎、基于 RAG 的 LLM 应用,以及需要在不同语言和模态下进行高性能语义搜索的多模态检索系统。

Highlights

  • Multimodal Support: 包括用于文本到图像和图像到文本搜索的 BGE-VL。
  • Versatile Retrieval: BGE-M3 支持在单个模型中同时进行密集、稀疏 (词汇) 和多向量 (ColBERT) 检索。
  • Multilingual Capabilities: 对超过 100 种语言提供广泛支持。
  • Comprehensive Pipeline: 提供涵盖推理、微调、评估和数据集管理的“一站式”解决方案。"},