ninjahawk/livenerf

Benchmark for tracking model capability after release.

解决的问题

livenerf 旨在检测“nerfing”——即前沿 AI 模型在初始发布后性能悄然下降的现象。它用一种确定性、长期运行的基准测试,取代了关于质量下降的主观传闻,通过与发布日基准进行对比,持续追踪模型性能随时间的变化。

工作原理

该项目采用严格的统计方法来衡量模型输出的漂移:

  • 信息量高的面板选择: 从大型数据集(GPQA Diamond、MMLU-Pro、竞赛数学、AIME)中筛选出模型偶尔能答对的问题(正确率约 30-70%),因为这些问题是变化最敏感的。
  • 确定性测试框架: 为消除噪声,固定 CLI 版本,冻结系统提示,并使用精确匹配评分器而非 LLM 判官。
  • 统计追踪: 每日运行相同的测试面板,并使用成对项目得分差异和聚类标准误,将结果与发布周基准进行比较。
  • 对照组: 同时运行一个对照模型(如 Claude Opus 5),以区分是模型本身退化,还是平台级基础设施变化所致。
  • Token 监控: 跟踪输出 Token 数量作为次要信号,因为“思考”Token 的减少通常预示着准确率下降。

适用人群

希望获得客观、数据驱动证据,以检测通过订阅接口(如 Claude Code)提供的前沿 LLM 性能漂移的研究人员和开发者。

主要亮点

  • 预注册协议: 使用公开的 git 时间戳,在数据收集开始前就承诺测量计划和决策规则。
  • 与 Inspect AI 集成: 基于英国 AI 安全研究所的开源评估框架构建。
  • 严格验证: 包含“正向对照”检查,确保测试系统在信任零结果前能够检测到已知的性能下降(如努力程度变化)。
  • 完全隔离执行: 确保每次调用都完全隔离,不使用任何外部工具、内存或设置,防止信息泄露。

相关

  • 项目
  • 项目
  • 项目
  • 项目