ninjahawk/livenerf
Benchmark for tracking model capability after release.
解决的问题
livenerf 旨在检测“nerfing”——即前沿 AI 模型在初始发布后性能悄然下降的现象。它用一种确定性、长期运行的基准测试,取代了关于质量下降的主观传闻,通过与发布日基准进行对比,持续追踪模型性能随时间的变化。
工作原理
该项目采用严格的统计方法来衡量模型输出的漂移:
- 信息量高的面板选择: 从大型数据集(GPQA Diamond、MMLU-Pro、竞赛数学、AIME)中筛选出模型偶尔能答对的问题(正确率约 30-70%),因为这些问题是变化最敏感的。
- 确定性测试框架: 为消除噪声,固定 CLI 版本,冻结系统提示,并使用精确匹配评分器而非 LLM 判官。
- 统计追踪: 每日运行相同的测试面板,并使用成对项目得分差异和聚类标准误,将结果与发布周基准进行比较。
- 对照组: 同时运行一个对照模型(如 Claude Opus 5),以区分是模型本身退化,还是平台级基础设施变化所致。
- Token 监控: 跟踪输出 Token 数量作为次要信号,因为“思考”Token 的减少通常预示着准确率下降。
适用人群
希望获得客观、数据驱动证据,以检测通过订阅接口(如 Claude Code)提供的前沿 LLM 性能漂移的研究人员和开发者。
主要亮点
- 预注册协议: 使用公开的 git 时间戳,在数据收集开始前就承诺测量计划和决策规则。
- 与 Inspect AI 集成: 基于英国 AI 安全研究所的开源评估框架构建。
- 严格验证: 包含“正向对照”检查,确保测试系统在信任零结果前能够检测到已知的性能下降(如努力程度变化)。
- 完全隔离执行: 确保每次调用都完全隔离,不使用任何外部工具、内存或设置,防止信息泄露。
相关
- 项目
- 项目
- 项目
- 项目