NVIDIA-NeMo/Evaluator

Open-source library for scalable, reproducible evaluation of AI models and benchmarks.

What it solves

NeMo Evaluator 提供了一個標準化的框架,用於在各種任務中測試和衡量 Large Language Models (LLMs) 的性能。它簡化了執行基準測試、管理模型交互以及分析結果的過程,減少了為每個新模型或數據集創建自定義評估腳本的需求。

How it works

該框架採用模組化架構,由幾個關鍵組件組成:

  • Benchmarks & Solvers: 它包含 17 個內置基準測試(涵蓋數學、代碼、安全性和安全性任務)並支持外部 harness integrations。

  • Adapter Proxy: 一個本地攔截代理位於代理與模型之間。它可以在不修改模型本身的情況下,緩存請求、記錄 token 使用量、修改 payload 或限制對話中的輪次。

  • Sandboxes: 對於需要代碼執行或代理行為的任務,系統會啟動 Docker 或 SLURM-based sandboxes 以安全地運行和驗證模型的輸出。

  • Reporting & Export: 結果會被處理成多格式報告,或導出到 Weights & Biases (wandb) 和 MLflow 等實驗追蹤器。

Who it’s for

它專為需要嚴格評估 LLM、比較不同模型版本,並實施品質閘道以決定模型是否準備好部署的 AI 研究人員和開發人員設計。

Highlights

  • Extensive Benchmark Library: 內置支持 MMLU, GSM8K, HumanEval, 和專門的代理任務基準測試如 PinchBench。
  • Pluggable Interceptors: 能夠在運行時動態修改 LLM 流量,用於緩存、記錄和系統消息注入。
  • Flexible Execution: 支持本地 Docker 容器和大規模 SLURM clusters 用於資源密集型評估。
  • Comparison Tools: 專用的 CLI 命令 (nel comparenel gate) 用於運行結果的統計比較以及基於策略的品質決策。",

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案