Hugging Face Open LLM Leaderboard MMLU 評估分析

Hugging Face 已經發現,在 Open LLM Leaderboard 上的 MMLU(Massive Multitask Language Understanding)分數差異——特別是針對 LLaMA 模型——源於基準在不同評估函式庫中的實作方式不同。這凸顯了 LLM 評估結果對提示格式和預測提取方法等微小細節極為敏感。

實作對 MMLU 分數的影響

相同 MMLU 資料集的不同軟體實作可能產生廣泛不同的絕對分數,並改變模型的排名。Hugging Face 比較了三種具體的實作:

  1. 原始實作:由開發 MMLU 的 UC Berkeley 團隊提出的程式碼。
  2. HELM 實作:斯坦福大學 Holistic Evaluation of Language Models (HELM) 提供的程式碼。
  3. EleutherAI LM Evaluation Harness:作為 Open LLM Leaderboard 後端使用的函式庫。

比較結果顯示,類似 LLaMA-65B 的模型在原始實作中得到 0.636 分,而在 Harness 實作中只有 0.488 分。這種差距(約 30%)可能會誤導研究者認為模型訓練不佳,而實際上差異來自評估方法。

評估方法的技術差異

差異主要源於兩個方面:提示的構建與分數的計算方法。

提示變體

即使輸入字串的微小變動也會影響模型輸出。三種實作間觀察到的差異包括:

  • 說明:開場句子的變化以及是否包含主題行。
  • 前綴:問題是否前面加上 "Question:" 標籤。
  • 選項格式:多選選項是否前面加上 "Choices" 關鍵字。

預測提取方法

這些函式庫從模型中提取答案有三種不同的方式:

  • 字母機率比較 (Original):模型對單一標記 "A"、"B"、"C"、"D" 的預測機率會被比較。即使模型寧願產生完全不同的詞語,這四個中的最高機率者獲勝。
  • 文字生成比較 (HELM):模型會生成一段文字回應,然後與預期的字母答案進行比較。如果模型產生的詞語不是預期的字母(例如 "Zygote"),則會被標記為錯誤。
  • 完整序列機率 (Harness - Jan 2023):函式庫會比較完整答案序列的機率(例如 "C. The second pharyngeal arch")。這涉及將該序列中每個標記的機率的對數相加。

評估方法摘要

實作 比較方法
原始 比較字母答案 (A, B, C, D) 的機率
HELM 期望模型以文字形式生成字母答案
AI Harness (Jan 2023) 比較完整答案序列 (Letter + Text) 的機率

結論與未來更新

評估結果並非絕對;它們與特定的實作、標記化和提示相關聯。為確保公平比較,Hugging Face 強調開放、標準化且可重現的基準(如 EleutherAI Eval Harness 和 Stanford HELM)的必要性。

為解決觀察到的差異,EleutherAI Harness 已經更新,使其 MMLU 評估更貼近原始實作。Hugging Face 目前正使用更新後的 EleutherAI Eval Harness v2 來更新 Open LLM Leaderboard,以反映這些變更。

Sources