embeddings-benchmark/mteb

MTEB: State-of-the-art evaluation of embeddings across languages and modalities

What it solves

MTEB 提供了一種標準化的方式來評估文本嵌入與檢索系統的性能。它消除了研究人員與開發人員手動設置多個數據集與評估指標的需要,提供了一個全面的基準測試,用於在各種任務中比較不同模型。

How it works

該工具箱允許用戶選擇特定的嵌入模型(可以從預定義的列表或自定義模型中選擇)並針對一組任務或基準測試進行運行。它支持 Python API 與命令行界面(CLI)來執行評估並輸出結果以供分析。

Who it's for

用於 AI 研究人員與開發人員,包括正在構建或微調嵌入模型的開發者,以及正在為特定檢索或分類任務選擇最佳嵌入模型的開發者。

Highlights

  • Comprehensive Benchmarking: 支持廣泛的任務與基準測試,包括通過 MMTEB 提供的多語言支持。
  • Easy Integration: 通過 pip 或 uv 進行簡單的安裝,並提供用於運行評估的直觀 API。
  • Citing Support: 內置功能,用於檢索評估中所使用的基準測試與任務的引用文獻。
  • Interactive Leaderboard: 維護一個公開的排行榜,用於追蹤與比較各種嵌入模型的性能。

相關