ninjahawk/livenerf
Benchmark for tracking model capability after release.
解決的問題
livenerf 是為了檢測「nerfing」——即前沿 AI 模型在初始發布後性能悄然下降的現象而設計。它以一種決定性、長期運行的基準測試,取代了關於品質下降的主觀報告,透過與發布日基準進行對比,持續追蹤模型性能隨時間的變化。
工作原理
該項目採用嚴格的統計方法來衡量模型輸出的漂移:
- 資訊量高的面板選擇: 從大型資料集(GPQA Diamond、MMLU-Pro、競賽數學、AIME)中篩選出模型偶爾能答對的問題(正確率約 30-70%),因為這些問題對變化最為敏感。
- 決定論性測試框架: 為消除雜訊,固定 CLI 版本,凍結系統提示,並使用精確匹配評分器而非 LLM 判官。
- 統計追蹤: 每日執行相同的測試面板,並使用成對項目得分差異與群集標準誤,將結果與發布週基準進行比較。
- 對照組: 同時執行一個對照模型(如 Claude Opus 5),以區分是模型本身退化,還是平台級基礎設施變更所致。
- Token 監控: 跟蹤輸出 Token 數量作為次要信號,因為「思考」Token 的減少通常預示著準確率下降。
適用對象
希望獲得客觀、數據驅動證據,以檢測透過訂閱介面(如 Claude Code)提供的前沿 LLM 性能漂移的研究人員與開發者。
主要亮點
- 預註冊協議: 使用公開的 git 時間戳,在資料收集開始前就承諾測量計畫與決策規則。
- 與 Inspect AI 集成: 基於英國 AI 安全研究所的開源評估框架建構。
- 嚴格驗證: 包含「正向對照」檢查,確保測試系統在信任零結果前能檢測到已知的性能下降(如努力程度變化)。
- 完全隔離執行: 確保每次呼叫都完全隔離,不使用任何外部工具、記憶體或設定,防止資訊洩漏。
相關
- 專案
- 專案
- 專案
- 專案