Anthropic 模型評估的統計方法
Anthropic 發布了一篇新的研究論文,「Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations」,為以科學嚴謹性報告 AI 模型評估結果提供了一個框架。其核心目標是確定模型在基準測試中的優異表現究竟是源於真實能力,還是僅僅是因所選特定問題的「運氣」所致。
透過中央極限定理量化技能
為了衡量獨立於特定問題集的底層技能,研究人員應專注於所有可能問題的理論平均值,而非特定基準測試的觀察平均值。
根據中央極限定理,來自相同分佈的隨機樣本的平均值服從常態分佈。Anthropic 建議在每個評估分數旁報告平均值的標準誤差 (SEM)。這允許透過從平均分數中加減 1.96 — SEM 來計算 95% 的信心區間,從而為模型的理論性能提供一個具有數學根據的衡量標準。
使用叢集標準誤差處理非獨立問題
許多流行的基準測試,例如 SQuAD、RACE、QuAC 和 DROP,違反了問題獨立性的假設,因為它們將多個問題圍繞在單一文本段落周圍。對這些叢集問題應用樸素的中央極限定理方法會低估標準誤差,這可能導致研究人員在不存在差異的情況下錯誤地檢測出能力差異。
Anthropic 建議在隨機化單元(例如文本段落)上進行標準誤差的叢集化。在實際測試中,Anthropic 發現,流行評估中的叢集標準誤差可能比樸素標準誤差大三倍以上。
減少問題內變異數的策略
減少分數中隨機成分的變異數,可以直接增加整體平均值的統計精確度。Anthropic 根據提示詞方法提出了兩種主要策略:
- 針對連鎖思考 (CoT) 推理: 研究人員應從同一模型多次重新採樣答案,並使用問題層級的平均值作為中央極限定理的輸入。Inspect 框架目前透過其
epochs參數來實現這一點。 - 針對非 CoT 推理: 隨機成分通常可以透過使用下一個 token 的機率來消除。例如,在一個多選題中,「B」是正確答案,分數應為模型分配給 token 「B」的機率,而非二元對錯結果。
透過配對差異分析提升信號
使用雙樣本 t 檢定來比較兩個模型,會忽略數據的共享結構。由於模型是在相同的問題列表中進行測試的,因此配對差異檢定 (paired-differences test) 更為有效,因為它消除了由問題難度引起的變異數,並專注於回應的變異數。
Anthropic 指出,前沿模型在問題分數上顯示出實質性的相關性(介於 0.3 到 0.7 之間),這意味著它們往往會答對或答錯相同的問題。報告平均值差異、標準誤差、信心區間和相關性,可以提供更清晰的相對性能信號。
使用檢定力分析進行評估設計
統計檢定力 (Statistical power) 是指檢定在兩個模型之間實際存在差異時檢測出該差異的能力。如果缺乏足夠的檢定力,微小但真實的能力差異可能無法被檢測到。
Anthropic 建議使用檢定力分析來:
- 制定特定的假設(例如,「模型 A 優於模型 B 3 個百分點」)。
- 計算測試該假設(相對於虛無假設,例如「模型 A 與模型 B 持平」)所需的題目數量。
- 確定答案重新採樣所需的次數以維持所需的檢定力特性。
- 根據預期的效應量 (effect size) 決定是否值得進行有限題目的評估。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch