netease-youdao/BCEmbedding

Netease Youdao's open-source embedding and reranker models for RAG products.

解決的問題

BCEmbedding 解決了雙語和跨語言檢索任務中的效能差距,特別是在中文和英文之間。它提供了一個兩階段檢索系統(嵌入和重排序),針對檢索增強生成(RAG)在各種專業領域(如醫學、法律和金融)進行了優化,且不需要特定任務的微調或指令。

運作方式

該專案實作了一個兩階段的檢索流程:

  1. 嵌入模型:一個雙編碼器,用於產生語意向量,以在英文和中文中進行高效的第一階段檢索。
  2. 重排序模型:一個交叉編碼器,執行更深入的語意分析以精煉和排序搜尋結果。它支援英文、中文、日文和韓文,並且可以處理長段落(最多 32k tokens)。

適用對象

它專為建構 RAG 應用程式且需要高精度跨語言搜尋能力的開發者設計,特別是那些整合 LangChain 或 LlamaIndex 等框架的開發者。

亮點

  • 雙語/跨語言能力:專門用於彌合中文和英文之間的語言差距。
  • RAG 優化:為翻譯、摘要和問答任務量身打造。
  • 無需指令:嵌入模型無需特定的查詢指令即可跨多個任務運作。
  • 長語境重排序:重排序器支援最多 32k tokens 的段落,並提供有意義的相關性分數以過濾低品質結果。
  • 輕鬆整合:包含內建工具,可與 LangChain 和 LlamaIndex 無縫使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案