embeddings-benchmark/mteb

MTEB: State-of-the-art evaluation of embeddings across languages and modalities

What it solves

MTEB 提供了一种标准化的方式来评估文本嵌入与检索系统性能。它消除了研究人员与开发人员手动设置多个数据集与评估指标的需求,提供了一个全面的基准测试,用于在各种任务中比较不同模型。

How it works

该工具箱允许用户选择特定的嵌入模型(可以从预定义列表或自定义模型中选择)),并针对一组任务或基准测试进行运行。它支持 Python API 与命令行界面(CLI)来执行评估并输出结果以供分析。

Who it's for

适用于 AI 研究人员与开发人员,包括正在构建或微调嵌入模型的开发者,以及正在为特定检索或分类任务选择最佳嵌入模型的开发者。

Highlights

  • Comprehensive Benchmarking: 支持广泛的任务与基准测试,包括通过 MMTEB 提供的多语言支持。
  • Easy Integration: 通过 pip 或 uv 进行简单的安装,并提供用于运行评估的直观 API。
  • Citing Support: 内置功能,用于检索评估中所使用的基准测试与任务的引用文献。
  • Interactive Leaderboard: 维护一个公开的排行榜,用于跟踪与比较各种嵌入模型的性能。

相关