Hugging Face 推出 RTEB 用於檢索嵌入評估
解決檢索中的泛化差距
現有的檢索基準常常在公開資料集上報告的零樣本表現與在未見過的真實世界資料上的實際表現之間存在落差。這主要由兩個因素造成:
- 基準過擬合: 當訓練資料與評估資料集重疊時,模型可能會記住測試資料,而非培養出穩健且可泛化的能力,導致分數被抬高。
- 應用不對齊: 許多現行基準依賴學術或問答衍生的資料集,無法捕捉企業使用情境的分布偏差與複雜性,或範圍過於狹窄(例如僅聚焦於程式碼檢索)。
RTEB 混合評估策略
為確保對模型泛化能力的公平且透明的衡量,RTEB 採用雙資料集方法:
- 開放資料集: 語料庫、查詢與相關性標籤全部公開,確保透明度與可重現性。
- 私有資料集: 這些資料集保持私密,僅由 MTEB 維護者評估。此舉防止資料外洩,並提供對未見資料的無偏績效衡量。為維持透明度,Hugging Face 會提供描述性統計、資料集說明與樣本三元組。
開放與私有資料集之間顯著的績效下降是過擬合的明確訊號。
技術設計與領域焦點
RTEB 為企業級檢索任務進行了最佳化,具備以下技術規格:
領域與語言覆蓋
- 多語言支援: 基準涵蓋 20 種語言,包括英語、日語等常見語言,以及孟加拉語、芬蘭語等資源較少的語言。
- 企業領域: 特別聚焦於高風險領域,包括法律、醫療保健、金融與程式碼。
評估指標與規模
- 主要指標: 預設排行榜指標為 NDCG@10,為衡量排序搜尋結果品質的業界標準。
- 資料集效率: 每個資料集至少包含 1,000 篇文件與 50 個查詢,以確保統計顯著性,同時避免評估成本過高。
目前限制與未來路線圖
Hugging Face 已辨識出 RTEB 持續演進的多個方向:
- 問答再利用: 約 50% 的現有資料集來源於問答集合,可能導致高度詞彙重疊,且偏向關鍵字匹配而非語意理解。
- 模態擴展: 目前版本僅支援文字;未來版本將加入文字-影像及其他多模態檢索任務。
- 語言擴展: 正在努力加入更多主要語言,特別是中文與阿拉伯語,以及其他低資源語言。
- 範圍: 基準目前聚焦於實際的檢索優先使用情境,而非高度挑戰性的合成資料集。
RTEB 資料集組成
開放資料集
開放資料集包含多種專業來源,例如 AILACasedocs 與 AILAStatutes(印度法律文件)、FinanceBench 與 FinQA(財務報告)、HumanEval 與 MBPP(程式碼),以及 ChatDoctor_HealthCareMagic(醫療問答)。
私有資料集
私有資料集包括來自德國、日本與法國的專業法律記錄,以及來自英語與德語來源的專家標註醫療保健資料,還有從 GitHub 抽取的專業程式碼函式。