NVIDIA-NeMo/Evaluator

Open-source library for scalable, reproducible evaluation of AI models and benchmarks.

What it solves

NeMo Evaluator 提供了一个标准化的框架,用于在各种任务中测试和衡量 Large Language Models (LLMs) 的性能。它简化了运行基准测试、管理模型交互以及分析结果的过程,减少了为每个新模型或数据集创建自定义评估脚本的需求。

How it works

该框架采用模块化架构,由几个关键组件组成:

  • Benchmarks & Solvers: 它包含 17 个内置基准测试(涵盖数学、代码、安全性和安全性任务)并支持外部 harness integrations。

  • Adapter Proxy: 一个本地拦截器代理位于代理与模型之间。它可以缓存请求、记录 token 使用量、修改 payload 或在不修改模型本身的情况下限制对话的轮次。

  • Sandboxes: 对于需要代码执行或代理行为的任务,系统会启动 Docker 或 SLURM-based sandboxes 以安全地运行和验证模型的输出。

  • Reporting & Export: 结果会被处理成多格式报告,或导出到 Weights & Biases (wandb) 和 MLflow 等实验追踪器。

Who it’s for

它专为需要严谨谨实地评估 LLM、比较不同模型版本,并实施质量闸门以决定模型是否准备好部署的 AI 研究人员和开发者设计。

Highlights

  • Extensive Benchmark Library: 内置支持 MMLU, GSM8K, HumanEval, 和专门的代理任务基准测试如 PinchBench。
  • Pluggable Interceptors: 能够动态修改 LLM 流量以进行缓存、缓存、记录和系统消息注入。
  • Flexible Execution: 支持本地 Docker 容器和大规模 SLURM clusters 用于资源密集型评估。
  • Comparison Tools: 专用的 CLI 命令 (nel comparenel gate) 用于运行结果的统计比较以及基于策略的质量决策。",

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目