livenerf: Claude Opus 5.5 のリリース後能力低下を検出する決定論的ベンチマーク

TL;DR – livenerf の機能と重要性

livenerf は、Claude Opus 5.5(Claude Code Max を経由)に対して、78個の「時々正解する」質問の固定パネルを継続的に実行し、リリース後10日間のベースラインと比較して、精度や出力トークン数に統計的に有意な変化があるかを報告します。このプロジェクトは、Anthropic がリリース後にモデルを「弱体化(nerf)」しているという主張を確認または否定できる、初めての公開・再現可能な時系列データを提供します。


核心貢献:決定論的で追加のみ可能なドリフト検出器

livenerf は、モデル自身の確率的性質以外のすべての非決定論的要因を排除します。Claude Code CLI のバージョンを固定し、システムプロンプトを凍結し、正確一致評価器を使用し、すべてのリクエストレベルのアーティファクト(プロンプト、応答、使用量、遅延、ハーネスのSHAなど)をログに記録します。30日間毎日同じパネルを実行することで、集団標準誤差を用いたアイテムごとのスコア差を測定し、Anthropic の Adding Error Bars to Evals(Miller 2024)の統計フレームワークに従います。この設計により、プロンプト、ツール、環境の変更によるドリフトが排除され、観測された変化はモデルまたはサービングスタックの影響に起因するものとみなされます。


ベンチマークの構築方法

1. キャリブレーションで情報量のある項目を抽出

モデルが「時々」正解する(約50%〜70%の正解率)項目のみを保持します。完全に正解するか完全に誤答する項目は劣化に関する情報を持ちません。キャリブレーションでは、GPQA-Diamond、MMLU-Pro、コンペティション数学、AIME 2025-26 の問題を4回ずつサンプリングし、合計2,336問から78個のパネル項目(後に2つ除外)を抽出しました。選択バイアスを補正した新規サンプルの正解率は62%です。

2. 対応する毎日の実行で項目難易度をキャンセル

毎日同じパネルを評価し、その結果をリリース後1〜10日目のベースラインスコアと比較します。アイテムごとの比較であるため、難易度の影響が相殺され、主な指標はアイテム間の平均対応差になります。

3. 二腕設計でプラットフォーム効果を制御

主腕:Claude Code Max を通じた Opus 5.5。 コントロール腕:前の世代である Claude Opus 5 が同じ GPQA サブセットを実行。両腕が同じ方向に動けば、変化はハーネスやインフラストラクチャの影響とみなされます。

4. 事前登録された検証で感度を証明

ベースラインデータ収集の前に、既知の劣化(努力度 medium 対 high)と A/A チェックを実行しました。検証結果では、26%のトークン使用量削減が –4.2 ± 3.9 ポイントの精度低下に対応し、62%の削減では –8.3 ± 4.5 ポイントの低下が確認されました。これにより、このツールが実際の努力関連の劣化を検出可能であることが立証されました。


実験の実行:スケジュールと現在の状況(2026-09-29時点)

フェーズ 日数 サンプル数 状態
ベースライン 1-10(リリース 2026-09-24) 90 サンプル/日 6日分収集済み、欠損なし
最初の10日間ウィンドウ 11-20 – 保留
2番目の10日間ウィンドウ 21-30 – 保留

すべての実行で固定された CLI バージョン 2.1.280(ハッシュ 461391b6fce64167)を使用しています。Day 5 では一時的な予算ガードオーバーライドが必要でしたが、その詳細はデバイエーションファイルに記録されています。


検出可能な効果サイズと限界

  • 1日の全パネル実行では、10日間のウィンドウで約7.5ポイントの精度変化を検出可能(週次計画の統計的パワーの約3.6%)。
  • Opus 5 と Opus 5.5 の区別は信頼性が低い:観測された差は –3.8 ± 6.3 ポイントであり、99%信頼水準では有意ではありません。
  • トークン使用量はより感度の高い早期指標。わずかな努力の削減が、精度に影響が出る前に大きなトークン数の低下として現れます。

ベンチマークの再現方法

  1. 環境 – Python 3.11+、uv、ログイン済みの Claude Code Max サブスクリプション。
  2. CLI の固定 – 自動更新を無効化し、claude --version を CLAUDE_CLI_VERSION に記録し、バイナリのコピーを ~/.local/share/livenerf に配置。
  3. インストール – git clone https://github.com/ninjahawk/livenerf && cd livenerf && uv sync。
  4. キャリブレーションと設計 – python -m livenerf.benchmarks.calibrate … を実行し、その後 python -m livenerf.design … を実行して data/standard_panel.json を生成し、パネルをロック。
  5. 検証 – python -m livenerf.validate run … を実行し、既知の努力劣化を検出できることを確認。
  6. プレフライト – python -m livenerf.preflight --probe が READY を出力するまでスケジューリングを待機。
  7. スケジューリング – 提供された scripts/daily.sh を cron(Linux/macOS)またはタスクスケジューラ(Windows)に追加し、1日1回実行。週間使用量ガード(75%以上または5時間あたり60%以上ならスキップ)を尊重。
  8. 分析 – 各10日間ウィンドウ終了後、python -m livenerf.analysis を実行し、対応差、集団標準誤差、自動判断(Δ > 3ポイント、99%信頼区間が0を含まない、コントロール腕は安定)を得る。

すべてのロールは logs/ ディレクトリに Inspect .eval ファイルとして保存され、追加のみで編集されません。


Hacker News でのコミュニティの反応

@jug – 「BridgeBenchのNerf Benchは、Anthropicが後にブログで言及したOpus 4.6の劣化を検出しました。"

@johnfn – 「大多数の『nerf』報告は認知バイアスです;新しいモデルが無限に能力があるように感じられる『ハネムーン効果』を説明する図があります。」

@Cider9986 – 「昨夜のClaude Codeチャットでnerfを確認しました;Nitterで検索すると同じ主張が見つかりました。"

@zeroonetwothree – 「このベンチマークがOpus 5とOpus 5.5を区別できないなら、役に立ちません。"

@nomilk – 「素晴らしいアイデアです;ベンダーや提供者を責任あるものにし、それが必要になること自体が少し恥ずかしいです。"

これらのコメントは、主観的な「nerf」体験と、体系的な測定が可能かどうかに対する懐疑主義の間の分断を示しています。livenerf は、事前登録済みで統計的に厳密なプロトコルを提供することで、後者に直接対応しています。


限界と未解決の問い

  • モデル特異性 – ベンチマークは Claude Code Max を通じた Claude Opus 5.5 のみを測定しており、直接APIモデルではありません。AzureやBedrockでのデプロイでは結果が異なる可能性があります。
  • パネルのプライバシー – 個々の質問本文は非公開(ハッシュのみ公開)に保たれ、独自の評価データの漏洩を防ぎます。
  • 検出限界 – 同一族のモデル交換(Opus 5 → 5.5)は現在の統計的パワー以下であり、より大きなサンプルサイズや長い期間が必要です。
  • 外部要因 – 負荷依存のサービング変更、セーフティ分類器の拒否、クォータースロットリングはトークン使用量に影響を与え、ログには記録されますが、完全に分離はできません。

今後の方向性

  • 他のフロンティアモデル(例:GPT-6 Astra)やAPI専用デプロイにもプロトコルを拡張。
  • コミュニティによる再現を可能にする公開合成パネルを発行しつつ、プライベートなキャリブレーション済み項目を保持。
  • AzureやBedrockなど複数プロバイダー間の比較を自動化し、「nerf」がプロバイダー特有かどうかを検証。
  • より細かいトークン使用量のシグナル(例:ステップごとの思考時間)を早期警告指標として調査。

貢献の仕方

貢献は、新しい純関数型の評価器、合成生成器、分析ツールの追加に限定してください。固定パネルやプロンプトの変更は新しいバージョンを生み出し、新しい事前登録コミットを伴う必要があります。すべてのPRは、LLM生成コンテンツを明示する必要があります。リポジトリ自体も一部がClaudeで作成されています。


引用

@misc{livenerf,
  author = {ninjahawk},
  title = {livenerf: tracking post‑launch capability drift in frontier models},
  year = {2026},
  publisher = {GitHub},
  url = {https://github.com/ninjahawk/livenerf}
}

Sources

関連