FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

解决的问题

BGE (BAAI General Embedding) 为改进检索增强生成 (RAG) 和搜索系统的检索阶段提供了一套全面的工具包。它解决了对高质量文本和多模态嵌入及重排序模型的需求,以确保为 LLM 提供最相关的文档进行处理。

工作原理

该工具包为整个检索流水线提供了一系列模型和工具:

  • Embedding Models: 将文本或图像转换为向量(嵌入),用于高效的相似度搜索。这包括专门的模型,如用于多语言、多粒度、多功能检索(dense、lexical 和 multi-vector)的 BGE-M3。
  • Rerankers: 交叉编码器模型,通过对嵌入模型返回的前 k 个文档进行更准确(但速度较慢)的评分,来优化检索结果。
  • Multimodal Capabilities: BGE-VL 支持视觉搜索应用,包括文本到图像和图像到文本的检索。
  • Fine-tuning & Evaluation: 包括在自定义数据上微调嵌入器和重排序器,并使用 C-MTEB 等基准测试评估其性能的工具。

适用对象

本项目面向需要最先进的嵌入和重排序能力的 RAG 应用、搜索引擎和多模态检索系统的开发人员和研究人员。

亮点

  • BGE-M3: 一款多功能模型,支持 100 多种语言、高达 8192 个 token 的输入长度以及三种检索方法(dense、lexical 和 multi-vector)。
  • 多模态支持: 包括用于全面视觉搜索的 BGE-VL 和用于混合图像-文本数据的 Visualized-BGE。
  • 全面的工具包: 为嵌入器和重排序器的推理、微调和评估提供一站式服务。
  • 高性能: 该系列中的许多模型在 MTEB 和 C-MTEB 等基准测试中排名很高。

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • 项目