BenchMIRT: 使用多維度項目反應理論審核 LLM 基準測試

BenchMIRT 是一種新的方法,用於在個別提示詞(prompt)層級審核大型語言模型(LLM)基準測試,以確定究竟是哪些底層能力在驅動基準測試的分數。透過分析模型在每個問題上的表現,BenchMIRT 讓研究人員能夠分離混合訊號——例如安全性與一般推理能力——這些訊號通常被合併成單一的總體分數。

多維度項目反應理論 (MIRT)

BenchMIRT 基於多維度項目反應理論(Multidimensional Item Response Theory, MIRT),這是一種心理計量技術,用於從測試反應模式中衡量特徵與能力。與假設測試衡量單一特徵的一維 IRT 不同,MIRT 可以分離出對同一組問題中模型表現有貢獻的多種能力。

BenchMIRT 在兩個層級運作:

  • Model Level: 它估計模型在所選基準測試所反映的特定能力方面的強度。
  • Question Level: 它估計問題的難度,以及該問題在區分在這些特定能力上較強或較弱的模型方面的能力。

為了驗證此方法,研究人員在 16 個基準測試(包括 MMLU-Pro, GPQA, MATH, BBH, HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, 和 XSTest)的結果上訓練了 BenchMIRT,涵蓋 100 個 LLM 和超過 34,000 個問題。在沒有被告知哪些基準測試衡量哪些能力的情況下,BenchMIRT 獨立且穩定地恢復了兩個主導維度:安全性與一般推理能力。

解構基準測試訊號

BenchMIRT 揭示了許多基準測試衡量的是多種能力的組合,而非單一預期的指標。雖然有些基準測試與其預期焦點一致,但其他基準測試顯示出複雜的重疊:

  • BBQ (Social Bias): 儘管被歸類為安全性基準測試,BBQ 與一般推理能力的關聯更強。這表明 BBQ 的低分可能反映了模型在推理問題時的困難,而非僅僅是其安全性行為。
  • WMDP (Dual-Use Knowledge): BenchMIRT 發現 WMDP 分數與一般推理能力的關聯比安全性更強。由於該基準測試獎勵拒絕危險知識,因此較強的一般推理能力與較低的 WMDP 分數相關聯。
  • HarmBench (Harmful Requests): 此基準測試混合了訊號。標準與情境問題與安全性一致,但與版權相關的問題(例如要求歌詞)則與一般推理能力更接近。

提高評估效率與精準度

透過識別哪些問題最具資訊量,BenchMIRT 可用於建立更有效率的評估,且不犧牲準確度:

  • Question Reduction: 僅保留分析基準測試中 10% 的問題,通常就能保留模型安全性或推理能力的相對排名。保留 50% 的問題通常能更緊密地匹配完整基準測試的衡量結果。
  • Performance Prediction: BenchMIRT 可以以 79% 的準確度預測模型是否能正確回答保留的問題,而簡單的平均分數基準線則為 70% 的準確度。

限制與風險

此分析受到幾項限制:

  • Temporal Limit: 訓練與評估模型均在 2025 年 3 月前發布,這意味著結果可能無法捕捉到更新一代的 LLM 行為。
  • Dimension Dependency: 發現的維度(安全性與推理)取決於所提供的特定基準測試集;不同的基準測試集可能會顯現出不同的能力。
  • Security Risk: 在安全性基準測試中識別出最具資訊量問題的能力,可能會被用於移除這些問題,從而建立一個較弱的評估,讓不安全的模型可以通過。

儘管存在這些種種權衡,BenchMIRT 提供了一個框架,用於進行更具針對性的基準測試設計,以及對 LLM 能力更透明的解釋。

Sources