Hugging Face 排行榜模板:實作 Vectara HHEM 排行榜

TL;DR

Hugging Face 已發布開源的排行榜模板,讓開發者能夠為大型語言模型(LLM)建立輕量且動態的評估看板。Vectara 利用這些模板推出了 Hughes Hallucination Evaluation Model(HHEM)排行榜,提供了一套標準化的方法來衡量與比較開源與商業 LLM 的幻覺率。

Hughes 幻覺評估模型(HHEM)

HHEM 是一個開源的分類模型,旨在評估幻覺的發生頻率——即在 LLM 產生的文件摘要中出現的無意義或與原始內容不符的文字。該模型可評估各式各樣的 AI 系統,包含商業模型如 GPT-4、Google Gemini 與 Anthropic Claude,以及開源模型如 Llama 2 與 Mistral 7B。

透過開源 HHEM,Vectara 旨在讓 LLM 幻覺的評估更為民主化,並提升社群對不同模型幻覺傾向差異的認識。HHEM 以幻覺研究先驅 Simon Hughes 的名字命名,以示致敬。

透過 HF 模板實作 HHEM 排行榜

Vectara 透過使用 Hugging Face 排行榜模板,將靜態的 GitHub 倉庫遷移至動態的 Hugging Face Space。此框架可管理模型提交請求,並自動更新結果。

基本設定

對於一般的排行榜,實作需要以下步驟:

  1. Cloning the space repository 至特定組織。
  2. Creating two associated datasets:一個「requests」資料集用於追蹤使用者對新 LLM 評估的提交,另一個「results」資料集則儲存最終的評估指標。
  3. Populating the results dataset 以初始資料,並更新「About」與「Citations」區段。

針對 HHEM 的進階客製化

由於 HHEM 的評估流程較單純的結果推送更為複雜,Vectara 在多個關鍵後端檔案中客製化了原始碼:

  • leaderboard/src/backend/model_operations.py:實作 SummaryGenerator(從私有評估資料集產生摘要,並計算 Answer Rate 與 Average Summary Length)以及 EvaluationModel(使用 HHEM 模型計算 Factual Consistency Rate 與 Hallucination Rate)。
  • leaderboard/src/backend/evaluate_model.py:定義 Evaluator 類別,協調 SummaryGeneratorEvaluationModel 以 JSON 格式產出結果。
  • leaderboard/src/backend/run_eval_suite.py:包含 run_evaluation 函式,將最終計算的結果上傳至 results 資料集,以在排行榜上顯示。
  • leaderboard/main_backend.py:管理待處理的評估請求佇列並執行自動評估,同時提供使用者複製現有結果的選項。

對 LLM 社群的影響

這些開源模板的可用性降低了建立專屬 LLM 排行榜的門檻。透過提供一套處理提交與更新流程的框架,Hugging Face 讓社群能夠超越靜態基準,朝向動態、社群驅動的評估系統前進,並能在新模型發布時即時追蹤其表現。

Sources