livenerf: Claude Opus 5.5의 출시 후 능력 저하를 탐지하기 위한 결정론적 벤치마크
TL;DR – livenerf가 하는 일과 그 중요성
livenerf는 Claude Code Max를 통해 Claude Opus 5.5에 대해 지속적으로 78개의 때때로 정답을 맞히는 질문 패널을 실행하고, 출시 후 첫 10일 기준과 비교해 정확도 또는 출력 토큰 수의 통계적으로 유의미한 변화를 보고합니다. 이 프로젝트는 Anthropic가 모델 출시 후 "nerf"(능력 저하)를 유도한다는 주장의 진위를 확인하거나 반박할 수 있는 처음으로 공개되고 재현 가능한 시계열 데이터를 제공합니다.
핵심 기여: 결정론적이고 추가 전용의 드리프트 탐지기
livenerf는 모델 자체의 확률적 특성 외에는 모든 비결정론적 요인을 격리합니다. Claude Code CLI 버전을 고정하고, 시스템 프롬프트를 동결하며, 정확히 일치하는 평가기(그레이더)를 사용하고, 모든 요청 수준의 아티팩트(프롬프트, 응답, 사용량, 지연 시간, 허니스 SHA 등)를 로깅합니다. 30일 동안 매일 동일한 패널을 실행함으로써, Anthropic의 Adding Error Bars to Evals (Miller 2024)의 통계 프레임워크에 따라 쌍체 차이를 측정하고 군집 표준 오차를 사용합니다. 이 설계는 프롬프트, 도구, 환경 변화로 인한 드리프트를 제거하여, 관측된 변화가 모델이나 서빙 스택의 변화 때문임을 명확히 합니다.
벤치마크 구축 방법
1. 캘리브레이션을 통해 정보성 있는 항목 선별
모델이 때때로만 정답을 맞히는 항목(약 50%~70% 통과율)만 유지합니다. 완전히 정답이거나 완전히 오답인 항목은 저하 여부에 대한 정보를 제공하지 않습니다. 캘리브레이션은 GPQA-Diamond, MMLU-Pro, 경쟁 수학, AIME 2025-26 문제 2,336개를 각각 4번 샘플링하여 78개의 패널 항목(나중에 2개 제외)을 도출했습니다. 이 항목들은 선택 편향을 보정한 후 신선한 샘플 통과율이 62%로 측정되었습니다.
2. 쌍체 일일 실행으로 항목 난이도 제거
매일 동일한 패널을 평가하고, 그 결과를 1~10일 기준의 동일 항목 기준점과 비교합니다. 항목별 비교이므로 난이도가 상쇄되며, 주요 지표는 항목 간 평균 쌍체 차이가 됩니다.
3. 이중 팔 설계로 플랫폼 효과 통제
주요 팔: Claude Code Max를 통해 Opus 5.5. 대조 팔: 이전 세대인 Claude Opus 5가 동일한 GPQA 하위 집합을 실행합니다. 두 팔이 함께 움직이면 변화는 허니스 또는 인프라 때문이며, 새로운 모델 때문이 아님을 의미합니다.
4. 사전 등록된 검증을 통한 민감도 입증
기준 데이터 수집 전에 알려진 저하(노력 수준 중간 대 높음)와 A/A 검사를 실행합니다. 검증 결과, 토큰 사용량 26% 감소는 정확도 -4.2 ± 3.9 포인트 하락과 대응하고, 토큰 사용량 62% 감소는 -8.3 ± 4.5 포인트 하락을 보였습니다. 이는 도구가 실제 노력 관련 회귀를 탐지할 수 있음을 입증합니다.
실험 실행: 일정 및 현재 상태 (2026-09-29 기준)
| 단계 | 일자 | 샘플 수 | 상태 |
|---|---|---|---|
| 기준 | 1-10 (출시 2026-09-24) | 하루 90개 샘플 | 6일 수집 완료, 오류 없음 |
| 첫 10일 창구 | 11-20 | – | 보류 |
| 두 번째 10일 창구 | 21-30 | – | 보류 |
모든 실행은 고정된 CLI 버전 2.1.280 (해시 461391b6fce64167)을 사용합니다. Day 5에는 일회성 예산 보호 오버라이드가 필요했으며, 이는 편차 파일에 기록되어 있습니다.
탐지 가능한 효과 크기 및 한계
- 전체 패널의 하루 실행은 10일 창구에서 정확도 변화 ~7.5포인트를 탐지할 수 있습니다 (주간 계획의 통계적 힘의 약 3.6%).
- Opus 5와 Opus 5.5를 신뢰할 수 있게 구분할 수 없습니다: 관측된 차이는 -3.8 ± 6.3포인트이며, 99% 신뢰수준에서 통계적으로 유의미하지 않습니다.
- 토큰 사용량은 더 민감한 초기 지표입니다; 적은 노력 감소가 정확도 변화보다 먼저 큰 토큰 감소로 나타납니다.
벤치마크 재현 방법
- 환경 – Python 3.11+,
uv, 그리고 로그인된 Claude Code Max 구독 계정. - CLI 고정 – 자동 업데이트 비활성화,
claude --version을CLAUDE_CLI_VERSION에 기록하고, 바이너리 복사본을~/.local/share/livenerf에 배치합니다. - 설치 –
git clone https://github.com/ninjahawk/livenerf && cd livenerf && uv sync. - 캘리브레이션 및 설계 –
python -m livenerf.benchmarks.calibrate …실행 후python -m livenerf.design …을 실행하여data/standard_panel.json생성 및 패널 고정. - 검증 –
python -m livenerf.validate run …을 실행하여 도구가 알려진 노력 저하를 탐지하는지 확인합니다. - 프리플라이트 –
python -m livenerf.preflight --probe가READY를 출력해야 스케줄링 가능합니다. - 스케줄링 – 제공된
scripts/daily.sh를 cron(리눅스/macOS) 또는 작업 스케줄러(윈도우)에 추가하여 하루에 한 번 실행합니다. 주간 사용량 가드(주간 미터 >75% 또는 5시간 미터 >60%이면 건너뜀)를 준수합니다. - 분석 – 각 10일 창구 후
python -m livenerf.analysis를 실행하여 쌍체 차이, 군집 표준 오차, 자동 결정(Δ > 3포인트, 99% CI가 0을 포함하지 않음, 대조 팔 안정)을 얻습니다.
모든 원시 로그는 logs/ 폴더의 Inspect .eval 파일로 저장되며, 추가 전용이며 수정되지 않습니다.
커뮤니티 반응 (Hacker News)
@jug – "BridgeBench의 Nerf Bench는 Anthropic가 나중에 블로그에 게시한 Opus 4.6의 저하를 탐지했습니다."
@johnfn – "대부분의 'nerf' 보고는 인지 편향입니다; 새로운 모델이 사용자가 복잡성 한계에 도달할 때까지 무한히 능력 있는 것처럼 느껴지는 '호텔리즘 효과'를 설명하는 그래픽이 있습니다."
@Cider9986 – "저는 어제 Claude Code 채팅에서 nerf를 봤습니다; 빠른 Nitter 검색으로 동일한 주장이 나왔습니다."
@zeroonetwothree – "만약 벤치마크가 Opus 5와 Opus 5.5를 구분할 수 없다면, 유용하지 않습니다."
@nomilk – "좋은 아이디어입니다; 제공업체를 책임 있게 만들고, 이것이 필요하다는 점이 약간 부끄럽습니다."
이 댓글들은 주관적인 "nerf" 경험과 체계적인 측정이 가능하다는 데 대한 회의주의 사이의 갈등을 보여줍니다. livenerf는 이를 직접적으로 해결하기 위해 사전 등록된, 통계적으로 엄격한 프로토콜을 제공합니다.
한계 및 미해결 질문
- 모델 특이성 – 이 벤치마크는 Claude Code Max를 통해 제공되는 Claude Opus 5.5만 측정하며, 원시 API 모델은 제외합니다. Azure 또는 Bedrock 배포에서는 결과가 다를 수 있습니다.
- 패널 프라이버시 – 개별 질문 텍스트는 비공개로 유지됩니다(해시만 공개)하여 특허된 평가 데이터 유출을 방지합니다.
- 탐지 한계 – 동일한 가족 간 교체(Opus 5 → 5.5)는 현재 통계적 힘 아래에 있습니다; 더 큰 샘플 크기 또는 더 긴 창구가 필요합니다.
- 외부 요인 – 부하에 따라 달라지는 서빙 변경, 안전 분류기 거부, 할당량 제한은 토큰 사용량에 영향을 미치며, 로깅되지만 완전히 분리되지 않습니다.
미래 방향성
- 다른 선도적 모델(GPT-6 Astra 등)과 API 전용 배포로 프로토콜 확장.
- 커뮤니티 재현을 위한 공개 합성 패널 게시와 함께, 비공개 캘리브레이션 항목 보존.
- Azure, Bedrock 등 다양한 제공업체 간 비교 자동화를 통해 "nerf"가 제공업체 특유인지 테스트.
- 더 세밀한 토큰 사용 신호(예: 단계별 사고 시간)를 조사하여 조기 경고 지표로 활용.
기여 방법
기여는 새로운 순수 함수 그레이더, 합성 생성기, 분석 도구만 추가해야 합니다. 고정된 패널이나 프롬프트를 변경하면 새로운 버전이 되며, 새로운 사전 등록 커밋과 함께 제출되어야 합니다. 모든 PR은 LLM 생성 콘텐츠를 공개해야 하며, 이 저장소 자체도 일부 Claude로 작성되었습니다.
인용
@misc{livenerf,
author = {ninjahawk},
title = {livenerf: tracking post-launch capability drift in frontier models},
year = {2026},
publisher = {GitHub},
url = {https://github.com/ninjahawk/livenerf}
}
Sources
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- Dispatch