FlagOpen/FlagEmbedding

Retrieval and Retrieval-augmented LLMs

解決的問題

BGE (BAAI General Embedding) 為改進檢索增強生成 (RAG) 與搜尋系統的檢索階段提供了一套全面的工具包。它解決了對高品質文本與多模態嵌入及重排序模型的需求,以確保為 LLM 提供最相關的文檔進行處理。

工作原理

該工具包為整個檢索流水線提供了一系列模型與工具:

  • Embedding Models: 將文本或圖像轉換為向量(嵌入),用於高效的相似度搜尋。這包括專門的模型,如用於多語言、多粒度、多功能檢索(dense、lexical 與 multi-vector)的 BGE-M3。
  • Rerankers: 交叉編碼器模型,透過對嵌入模型回傳的前 k 個文檔進行更準確(但速度較慢)的評分,來優化檢索結果。
  • Multimodal Capabilities: BGE-VL 支援視覺搜尋應用,包括文本到圖像與圖像到文本的檢索。
  • Fine-tuning & Evaluation: 包括在自定義數據上微調嵌入器與重排序器,並使用 C-MTEB 等基準測試評估其性能的工具。

適用對象

本專案面向需要最先進的嵌入與重排序能力的 RAG 應用、搜尋引擎與多模態檢索系統的開發人員與研究人員。

亮點

  • BGE-M3: 一款多功能模型,支援 100 多種語言、高達 8192 個 token 的輸入長度以及三種檢索方法(dense、lexical 與 multi-vector)。
  • 多模態支援: 包括用於全面視覺搜尋的 BGE-VL 與用於混合圖像-文本數據的 Visualized-BGE。
  • 全面的工具包: 為嵌入器與重排序器的推理、微調與評估提供一站式服務。
  • 高性能: 該系列中的許多模型在 MTEB 與 C-MTEB 等基準測試中排名很高。

相關

  • 專案
  • 專案
  • Dispatch
  • Dispatch
  • 專案