ninjahawk/livenerf

Benchmark for tracking model capability after release.

해결하는 문제

livenerf는 초기 출시 후 성능이 조용히 저하되는 현상인 '너프링(nerfing)'을 탐지하기 위해 설계되었습니다. 품질 저하에 대한 주관적 보고를 대체하여, 출시일 기준과 비교해 모델 성능을 장기간에 걸쳐 결정론적으로 측정하는 벤치마크를 제공합니다.

작동 방식

이 프로젝트는 모델 출력의 변동을 엄격한 통계적 접근법으로 측정합니다:

  • 정보성 높은 패널 선택: GPQA Diamond, MMLU-Pro, 경쟁 수학, AIME와 같은 대규모 데이터셋에서 모델이 때때로 정답을 맞히는 문제(정답률 약 30~70%)만을 필터링합니다. 이러한 문제는 변화에 가장 민감합니다.
  • 결정론적 하네스: 노이즈를 제거하기 위해 CLI 버전을 고정하고, 시스템 프롬프트를 고정하며, LLM 평가자 대신 정확한 일치 평가기를 사용합니다.
  • 통계적 추적: 동일한 패널을 매일 실행하고, 쌍체별 항목별 점수 차이와 군집화된 표준 오차를 사용해 출시 주간 기준과 결과를 비교합니다.
  • 제어군: 대상 모델과 병행하여 제어 모델(예: Claude Opus 5)을 실행하여, 모델 자체의 저하인지 플랫폼 전체 인프라 변화인지 구분합니다.
  • 토큰 모니터링: 출력 토큰 수를 보조 신호로 추적하며, '사고' 토큰 수 감소는 종종 정확도 하락의 전조입니다.

대상 사용자

특히 Claude Code와 같은 구독 인터페이스를 통해 제공되는 선도적 LLM에서의 모델 드리프트에 대해 객관적이고 데이터 기반의 증거를 원하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 사전 등록된 프로토콜: 데이터 수집 시작 전에 공개된 git 타임스탬프를 사용해 측정 계획과 결정 규칙을 사전에 확정합니다.
  • Inspect AI 통합: UK AI Security Institute의 오픈소스 평가 프레임워크를 기반으로 구축되었습니다.
  • 엄격한 검증: 이미 알려진 저하(예: 노력 수준 변경)를 탐지할 수 있는 '긍정적 제어' 검사를 포함하여, null 결과를 신뢰하기 전에 시스템의 탐지 능력을 검증합니다.
  • 완전 고립 실행: 외부 도구, 메모리, 설정 없이 모든 호출을 고립된 환경에서 실행하여 누수를 방지합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트