ninjahawk/livenerf

Benchmark for tracking model capability after release.

何を解決するか

livenerf は、初期リリース後に性能が静かに低下する現象である「ネルフィング」を検出するために設計されています。品質の低下に関する主観的な報告を、リリース日ベースとの比較で長期にわたって定量化可能なベンチマークに置き換えます。

動作方法

このプロジェクトは、モデル出力の変化を厳密に統計的に測定するアプローチを採用しています:

  • 情報量の高いパネル選定: 大規模データセット(GPQA Diamond、MMLU-Pro、コンペティション数学、AIME)から、モデルが「時々」正解する問題(正解率約30〜70%)のみを抽出します。こうした問題は変化に対して最も感度が高いためです。
  • 決定論的ハーネス: ノイズを排除するため、CLIバージョンを固定し、システムプロンプトを固定し、LLMジャッジではなく正確一致評価を使用します。
  • 統計的追跡: 同じパネルを毎日実行し、パッドされたアイテムごとのスコア差とクラスタ化された標準誤差を用いて、リリース週のベースラインと比較します。
  • コントロールアーム: 対象モデルと並行して、コントロールモデル(例:Claude Opus 5)を実行し、モデルの劣化か、プラットフォーム全体のインフラ変更かを区別します。
  • トークン監視: 出力トークン数を二次的な指標として監視します。思考用トークンの減少は、精度の低下の前触れとなることがよくあります。

対象ユーザー

サブスクリプションインターフェース(例:Claude Code)を通じて提供される先端LLMにおけるモデルの漂移を、客観的かつデータ駆動で検証したい研究者や開発者向けです。

主な特徴

  • 事前登録されたプロトコル: データ収集開始前に、公開されたgitタイムスタンプを用いて測定計画と意思決定ルールを事前に確定します。
  • Inspect AI統合: UK AI Security Instituteのオープンソース評価フレームワークに基づいて構築されています。
  • 厳密な検証: 「ポジティブコントロール」チェックを含み、既知の劣化(例:努力レベルの変更)を検出できるかを確認した上で、結果が「ノルマル」であることを信頼します。
  • 完全に隔離された実行: すべての呼び出しを外部ツール、メモリ、設定なしで隔離し、漏洩を防ぎます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト