FlagOpen/FlagEmbedding
Retrieval and Retrieval-augmented LLMs
解決的問題
BGE (BAAI General Embedding) 為改進檢索增強生成 (RAG) 與搜尋系統的檢索階段提供了一套全面的工具包。它解決了對高品質文本與多模態嵌入及重排序模型的需求,以確保為 LLM 提供最相關的文檔進行處理。
工作原理
該工具包為整個檢索流水線提供了一系列模型與工具:
- Embedding Models: 將文本或圖像轉換為向量(嵌入),用於高效的相似度搜尋。這包括專門的模型,如用於多語言、多粒度、多功能檢索(dense、lexical 與 multi-vector)的 BGE-M3。
- Rerankers: 交叉編碼器模型,透過對嵌入模型回傳的前 k 個文檔進行更準確(但速度較慢)的評分,來優化檢索結果。
- Multimodal Capabilities: BGE-VL 支援視覺搜尋應用,包括文本到圖像與圖像到文本的檢索。
- Fine-tuning & Evaluation: 包括在自定義數據上微調嵌入器與重排序器,並使用 C-MTEB 等基準測試評估其性能的工具。
適用對象
本專案面向需要最先進的嵌入與重排序能力的 RAG 應用、搜尋引擎與多模態檢索系統的開發人員與研究人員。
亮點
- BGE-M3: 一款多功能模型,支援 100 多種語言、高達 8192 個 token 的輸入長度以及三種檢索方法(dense、lexical 與 multi-vector)。
- 多模態支援: 包括用於全面視覺搜尋的 BGE-VL 與用於混合圖像-文本數據的 Visualized-BGE。
- 全面的工具包: 為嵌入器與重排序器的推理、微調與評估提供一站式服務。
- 高性能: 該系列中的許多模型在 MTEB 與 C-MTEB 等基準測試中排名很高。
相關
- 專案
- 專案
- Dispatch
- Dispatch
- 專案