NVIDIA-NeMo/Evaluator

Open-source library for scalable, reproducible evaluation of AI models and benchmarks.

What it solves

NeMo Evaluatorは、幅広いタスクスクリプトにおいて、大規模言語モデル(LLM)の性能をテストし、測定するための標準化されたフレームワークを提供します。ベンチマークの実行、モデルとのインタラクション管理、結果の分析を簡素化し、新しいモデルやデータセットごとにカスタム評価スクリプトを作成する必要性を軽減します。

How it works

このフレームワークは、いくつかの主要なコンポーネントで構成されるモジュール式アーキテクチャを採用しています:

  • Benchmarks & Solvers: 17種類の組み込みベンチマーク(数学、コード、安全性、エージェントタスク)を含み、外部harness integrationsをサポートします。「Solvers」は、モデルがタスクとどのようにインタラクションするか(例:シンプルなチャット、ツール呼び出し、またはエージェント実行)を決定します。
  • Adapter Proxy: ローカルなインターセプタープロキシがエージェントとモデルの間に位置します。リクエストをキャッシュ、トークン使用量のログ記録、ペイロードの変更、またはモデル自体を変更することなく会話のターン数を制限することができます。
  • Sandboxes: コード実行やエージェント動作が必要なタスクの場合、システムはDockerまたはSLURM-based sandboxesを立ち上げ、モデルの出力を安全に実行・検証します。
  • Reporting & Export: 結果はマルチフォーマットレポートに処理されるか、Weights & Biases (wandb) や MLflow などの実験トラッカーにエクスポートされます。

Who it’s for

AI研究者や開発者が、LLMを厳密に評価、異なるモデルバージョンを比較、およびデプロイメント準備が整っているか判断するための品質ゲートを実装するために設計されています。

Highlights

  • Extensive Benchmark Library: MMLU, GSM8K, HumanEval, および PinchBenchのような専門的なエージェントベンチマークを組み込みサポートしています。
  • Pluggable Interceptors: キャッシュ、ログ記録、システムメッセージの注入などのために、LLMトラフィックを動的に変更する能力があります。
  • Flexible Execution: リソース集約的な評価のため、ローカルのDockerコンテナおよび大規模なSLURM clustersをサポートしています。
  • Comparison Tools: 実行結果の統計的な比較やポリシーベースの品質決定のための専用CLIコマンド (nel compare and nel gate) が用意されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト