Hugging Face 推出用于检索嵌入评估的 RTEB
Hugging Face 已推出检索嵌入基准(RTEB)的 beta 版本,这一新标准旨在可靠地评估嵌入模型在实际应用中的检索准确性。RTEB 通过采用开放和私有数据集的混合策略,解决了现有基准中出现的“泛化差距”,防止模型出现“对测试进行教学”的情况。
解决检索中的泛化差距
现有的检索基准常常存在报告的公开数据集零样本性能与在未见真实数据上的实际性能之间的差异。这主要由以下两个因素导致:
- 基准过拟合: 当训练数据与评估数据集重叠时,模型可能会记住测试数据而不是发展出稳健的可泛化能力,从而导致分数被夸大。
- 应用不匹配: 许多当前基准依赖于学术或问答衍生的数据集,这些数据集未能捕捉企业使用场景的分布偏差和复杂性,或者范围过窄(例如,仅关注代码检索)。
RTEB 的混合评估策略
为了确保对模型泛化能力的公平透明衡量,RTEB 采用了双数据集方法:
- 开放数据集: 语料库、查询和相关性标签全部公开,便于透明性和可重复性。
- 私有数据集: 这些数据保持私密,仅由 MTEB 维护者进行评估。此举防止数据泄漏,并提供对未见数据性能的无偏衡量。为保持透明度,Hugging Face 提供了描述性统计信息、数据集描述以及这些私有集合的示例三元组。
开放与私有数据集之间显著的性能下降是过拟合的明确信号。
技术设计与领域聚焦
RTEB 针对企业级检索任务进行优化,具备以下技术规格:
领域与语言覆盖
- 多语言支持: 基准覆盖 20 种语言,包括英语、日语等常用语言,以及孟加拉语、芬兰语等低资源语言。
- 企业领域: 特别关注高风险领域,包括法律、医疗保健、金融和代码。
评估指标与规模
- 主要指标: 默认排行榜指标为 NDCG@10,这是衡量排序搜索结果质量的行业标准。
- 数据集效率: 每个数据集至少包含 1,000 篇文档和 50 条查询,以确保统计显著性,同时避免评估成本过高。
当前局限性与未来路线图
Hugging Face 已识别出 RTEB 进一步演进的若干方向:
- 问答复用: 约 50% 的当前数据集来源于问答集合,这可能导致高词汇重叠,倾向于关键词匹配而非语义理解。
- 模态扩展: 当前版本仅限文本;未来版本计划加入文本-图像及其他多模态检索任务。
- 语言扩展: 正在努力添加更多主要语言,特别是中文和阿拉伯语,以及其他低资源语言。
- 范围: 该基准目前侧重于真实的检索优先使用场景,而非高度挑战性的合成数据集。
RTEB 数据集组成
开放数据集
开放数据集包括多种专业来源,如 AILACasedocs 与 AILAStatutes(印度法律文档)、FinanceBench 与 FinQA(金融报告)、HumanEval 与 MBPP(代码),以及 ChatDoctor_HealthCareMagic(医学问答)。
私有数据集
私有数据集包括来自德国、日本和法国的专业法律记录,以及来自英语和德语来源的专家标注医疗保健数据和从 GitHub 提取的专业代码函数。