EvalEval 和英國AI安全研究所(AISI)發布前沿大語言模型基準的公開評估卡片
TL;DR
EvalEval 和英國AI安全研究所(AISI)已公開發布五項高知名度基準(HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0)的已驗證評估卡片,涵蓋六種前沿大語言模型,提供重現評估所需的完整配置、運算資源與協定細節。
為何可重現的評估報告至關重要
可重現性至關重要,因為評估結果日益成為模型效能與安全性的主要證據。目前的報告格式與平台分散,經常遺漏關鍵細節,例如推論運算資源、評估協定與資料分割方式,導致重複實驗成本過高。EvalEval 透過兩項核心成果解決此問題:
- Every Eval Ever (EEE) 模式 – 用於基準資料、模型資料與執行參數的共享機器可讀規格。
- 評估卡片 – 一個開放存取的平台,儲存符合 EEE 標準的記錄,將評分與精確的實驗設定連結起來。
結合 AISI 對高效且統計嚴謹評估的研究(例如 OptStop、HiBayES),雙方合作旨在診斷報告缺口,並提供透明評估的標準化基礎設施。
AISI 分享的內容
AISI 已上傳其近期論文《How Inference Compute Shapes Frontier LLM Evaluation》(arXiv:2606.17930)中列出的五項基準的評估卡片。每張卡片包含:
- 各基準的已驗證分數。
- 完整背景資訊,包括模型版本(Claude Opus 4、4.5、4.6;GPT-5、5.2、5.4)、推論時運算預算、token 限制與評估協定。
- 配置細節,例如提示模板、取樣設定與任何來源反饋機制。
此次發布還包含兩項輔助性網路安全評估(Cyber CTFs 與 The Last Ones),使用部分重疊的模型集合。透過揭露這些細節,研究人員可:
- 探討運算資源或協定變更如何影響效能(例如 Humanity’s Last Exam 的 token 效率曲線)。
- 比較看似數值相近但於不同條件下取得的結果。
- 將卡片用作元研究與政策分析的已驗證參考點。
Humanity’s Last Exam 的表現會隨著評估協定與推論運算資源而改變。每條曲線顯示在特定 token 數量內,成功解決嘗試任務的累積比例,使用每項任務的最早成功觀察值。
社群如何參與
EvalEval 聯盟邀請三類群體協助擴展生態系:
- 模型開發者 – 透過 Get Verified 流程提交其模型的已驗證評估卡片。
- 基準開發者 – 使用開源 EEE 模式編碼新基準並執行資料(GitHub 連結提供)。
- 評估、治理與政策研究者 – 探索公開卡片資料庫,評估報告品質、進行元分析或支援法規架構制定。
關於 EvalEval 聯盟
EvalEval 聯盟是一個專注於建立穩健、科學基礎的 AI 評估基礎設施的研究社群。其旗艦專案包括:
- Every Eval Ever – 用於評估結果的通用模式與公開資料庫。
- 評估卡片 – 一個整合基準資料、執行資料與模型資料的介面,形成可解釋、可比較的記錄。
這些工具使我們能夠偵測到相同分數是否來自本質上不同的實驗條件,從而提升評估驅動決策的可靠性。
關於英國AI安全研究所(AISI)
AISI 是英國政府研究機構,隸屬於科學、創新與科技部。其使命是為政府提供關於先進AI風險的科學洞見。AISI 的工作包括:
- OptStop – 透過早期中止無望的執行來降低評估成本的方法。
- HiBayES – 使用分層貝葉斯建模,產生統計嚴謹的大語言模型評估。
- 在各基準間標準化轉錄分析與能力探測。
更多閱讀
- How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)
- HiBayES: 使用分層貝葉斯建模改善大語言模型評估 (AISI部落格 & arXiv:2505.05602)
- OptStop 論文 (arXiv:2608.14425)
- Every Eval Ever 專案頁面
- 評估卡片平台