FlagOpen/FlagEmbedding
Retrieval and Retrieval-augmented LLMs
解决的问题
BGE (BAAI General Embedding) 为改进检索增强生成 (RAG) 和搜索系统的检索阶段提供了一套全面的工具包。它解决了对高质量文本和多模态嵌入及重排序模型的需求,以确保为 LLM 提供最相关的文档进行处理。
工作原理
该工具包为整个检索流水线提供了一系列模型和工具:
- Embedding Models: 将文本或图像转换为向量(嵌入),用于高效的相似度搜索。这包括专门的模型,如用于多语言、多粒度、多功能检索(dense、lexical 和 multi-vector)的 BGE-M3。
- Rerankers: 交叉编码器模型,通过对嵌入模型返回的前 k 个文档进行更准确(但速度较慢)的评分,来优化检索结果。
- Multimodal Capabilities: BGE-VL 支持视觉搜索应用,包括文本到图像和图像到文本的检索。
- Fine-tuning & Evaluation: 包括在自定义数据上微调嵌入器和重排序器,并使用 C-MTEB 等基准测试评估其性能的工具。
适用对象
本项目面向需要最先进的嵌入和重排序能力的 RAG 应用、搜索引擎和多模态检索系统的开发人员和研究人员。
亮点
- BGE-M3: 一款多功能模型,支持 100 多种语言、高达 8192 个 token 的输入长度以及三种检索方法(dense、lexical 和 multi-vector)。
- 多模态支持: 包括用于全面视觉搜索的 BGE-VL 和用于混合图像-文本数据的 Visualized-BGE。
- 全面的工具包: 为嵌入器和重排序器的推理、微调和评估提供一站式服务。
- 高性能: 该系列中的许多模型在 MTEB 和 C-MTEB 等基准测试中排名很高。
相关
- 项目
- 项目
- Dispatch
- Dispatch
- 项目