ninjahawk/livenerf

Benchmark for tracking model capability after release.

解決的問題

livenerf 是為了檢測「nerfing」——即前沿 AI 模型在初始發布後性能悄然下降的現象而設計。它以一種決定性、長期運行的基準測試,取代了關於品質下降的主觀報告,透過與發布日基準進行對比,持續追蹤模型性能隨時間的變化。

工作原理

該項目採用嚴格的統計方法來衡量模型輸出的漂移:

  • 資訊量高的面板選擇: 從大型資料集(GPQA Diamond、MMLU-Pro、競賽數學、AIME)中篩選出模型偶爾能答對的問題(正確率約 30-70%),因為這些問題對變化最為敏感。
  • 決定論性測試框架: 為消除雜訊,固定 CLI 版本,凍結系統提示,並使用精確匹配評分器而非 LLM 判官。
  • 統計追蹤: 每日執行相同的測試面板,並使用成對項目得分差異與群集標準誤,將結果與發布週基準進行比較。
  • 對照組: 同時執行一個對照模型(如 Claude Opus 5),以區分是模型本身退化,還是平台級基礎設施變更所致。
  • Token 監控: 跟蹤輸出 Token 數量作為次要信號,因為「思考」Token 的減少通常預示著準確率下降。

適用對象

希望獲得客觀、數據驅動證據,以檢測透過訂閱介面(如 Claude Code)提供的前沿 LLM 性能漂移的研究人員與開發者。

主要亮點

  • 預註冊協議: 使用公開的 git 時間戳,在資料收集開始前就承諾測量計畫與決策規則。
  • 與 Inspect AI 集成: 基於英國 AI 安全研究所的開源評估框架建構。
  • 嚴格驗證: 包含「正向對照」檢查,確保測試系統在信任零結果前能檢測到已知的性能下降(如努力程度變化)。
  • 完全隔離執行: 確保每次呼叫都完全隔離,不使用任何外部工具、記憶體或設定,防止資訊洩漏。

相關

  • 專案
  • 專案
  • 專案
  • 專案