FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

What it solves

BGE (BAAI General Embedding) 提供了一個全面的工具包,用於改進檢索增強生成 (RAG) 與搜尋系統的檢索階段。它解決了如何將文字、圖片及多語言內容準確地映射到向量表示(embeddings)中的挑戰,以便從大型數據集中高效地檢索相關資訊。

How it works

BGE 為整個檢索流程提供了一系列模型與工具:

  • Embedders: 將文字或圖片轉換為向量的模型。這包括專門的模型,如 BGE-M3(支援密集型、詞彙型與多向量檢索)以及用於多模態視覺搜尋的 BGE-VL。
  • Rerankers: 交叉編碼器(Cross-encoder)模型,用於精煉初次檢索的結果,以提供更準確的 top-k 文件檢索排名。
  • Finetuning: 用於將這些模型適應於特定領域或任務的工具,包括用於挖掘硬負樣本(hard negatives)與添加指令的腳本。
  • Evaluation: 用於衡量檢索與排序模型效能的框架。

Who it’s for

此工具包是為開發者與研究人員設計的,旨在構建搜尋引擎、基於 RAG 的 LLM 應用程式,以及需要在不同語言與模態下進行高效能語義搜尋的多模態檢索系統。

Highlights

  • Multimodal Support: 包含用於文字轉圖片與圖片轉文字搜尋的 B GE-VL。
  • Versatile Retrieval: BGE-M3 支援在單一模型中同時進行密集型、稀疏型(詞彙型)與多向量 (ColBERT) 檢索。
  • Multilingual Capabilities: 對超過 100 種語言提供廣泛的支援。
  • Comprehensive Pipeline: 提供涵蓋推理、微調、評估與數據集管理的一站式解決方案。"},