NVIDIA-NeMo/Evaluator
Open-source library for scalable, reproducible evaluation of AI models and benchmarks.
What it solves
NeMo Evaluator는 다양한 작업에 걸쳐 대규모 언어 모델(LLM)의 성능을 테스트하고 측정하기 위한 표준화된 프레임워크를 제공합니다. 벤치마크 실행, 모델 상호작용 관리, 결과 분석 프로세스를 단순화하여 새로운 모델이나 데이터셋을 위해 커스텀 평가 스크립트를 작성할 필요성을 줄여줍니다.
How it works
이 프레임워크는 다음과 같은 몇 가지 핵심 구성 요소로 구성된 모듈식 아키텍처를 사용합니다:
- Benchmarks & Solvers: 17개의 내장 벤치마크(수학, 코드, 안전성, 에이전트 작업 포함)를 포함하며 외부 harness integrations를 지원합니다. "Solvers"는 모델이 작업과 어떻게 상호작용하는지(예: 단순 채팅, 도구 호출 또는 에이전트 실행)를 결정합니다.
- Adapter Proxy: 로컬 인터셉터 프록시가 에이전트와 모델 사이를 중개합니다. 모델 자체를 변경하지 않고도 요청을 요청을 캐싱, 토큰 사용량 로그 기록, 페이로드 수정, 또는 대화의 턴 수를 제한할 수 있습니다.
- Sandboxes: 코드 실행 또는 에이전트 동작이 필요한 작업의 경우, 시스템은 Docker 또는 SLURM-based sandboxes를 실행하여 모델의 출력을 안전하게 검증합니다.
- Reporting & Export: 결과는 멀티 포맷 보고서로 처리되거나 Weights & Biases (wandb) 및 MLflow 같은 실험 트래커에 내보보내집니다.
Who it’s for
LLM을 엄격하게 평가하고, 서로 다른 모델 버전을 비교하며, 배포 준비가 되었는지 결정하기 위한 품질 게이트를 구현해야 하는 AI 연구자 및 개발자를 위해 설계되었습니다.
Highlights
- Extensive Benchmark Library: MMLU, GSM8K, HumanEval, 그리고 PinchBench와 같은 전문적인 에이전트 벤치마크를 내장 지원합니다.
- Pluggable Interceptors: 캐싱, 로깅, 시스템 메시지 주입을 위해 LLM 트래픽을 실시간으로 수정할 수 있는 기능이 있습니다.
- Flexible Execution: 리소스 집약적인 평가를 위해 로컬 Docker 컨테이너와 대규모 SLURM clusters를 지원합니다.
- Comparison Tools: 전용 CLI 명령 (
nel compare및nel gate)을 사용하여 실행 결과의 통계적 비교 및 정책 기반 품질 결정이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트