NVIDIA Nemotron 3 Nano와 NeMo Evaluator 오픈 평가 레시피

TL;DR

NVIDIA는 300억 파라미터를 가진 Nemotron 3 Nano A3B 모델을 NeMo Evaluator 라이브러리를 기반으로 한 완전한 오픈 평가 레시피와 함께 출시했으며, 누구나 벤치마크 점수를 재현하고 평가 파이프라인의 모든 단계를 감사할 수 있게 했습니다.

오픈 평가가 중요한 이유

오픈 평가는 보고된 점수를 부풀리거나 낮출 수 있는 숨겨진 변수를 제거합니다. 정확한 구성 파일, 추론 설정, 로그 및 아티팩트 레이아웃을 공개함으로써, NVIDIA는 모델 성능이 실제 능력을 반영하는지 아니면 단순히 튜닝된 벤치마크 설정인지 검증할 수 있게 합니다.

단일하고 일관된 평가 시스템

NeMo Evaluator는 벤치마크, 프롬프트, 런타임 파라미터 및 추론 백엔드를 정의하기 위한 통합 인터페이스를 제공합니다. 동일한 YAML 구성을 모델 릴리스 전반에 걸쳐 재사용할 수 있어, 장기 비교를 깨뜨릴 수 있는 은밀한 변경을 방지합니다.

추론 설정과 무관한 방법론

NeMo Evaluator는 평가 워크플로우를 추론 엔진과 분리합니다. 모델이 NVIDIA의 호스팅 엔드포인트, Hugging Face Inference API, OpenRouter 또는 로컬 배포를 통해 접근되든, 동일한 평가 정의가 적용되어 인프라 변경에도 일관된 결과를 보장합니다.

일회성 실험을 넘어 확장

NeMo Evaluator의 런처, 아티팩트 레이아웃 및 구성 모델은 반복적이고 대규모 실행을 위해 설계되었습니다. 팀은 단일 벤치마크 검증에서 전체 모델 카드 스위트로 전환할 때 스크립트를 다시 작성할 필요 없이 방법론적 일관성을 유지할 수 있습니다.

구조화된 아티팩트와 로그를 통한 감사 가능성

각 실행은 자동으로 다음을 생성합니다:

  • 작업별 원시 점수를 포함한 results.json 파일.
  • 디버깅을 위한 포괄적인 실행 로그.
  • 결정적인 디렉터리 구조 (artifacts/logs/).

이러한 아티팩트를 통해 최종 숫자가 어떻게 도출되었는지 추적하고 모델 동작에 대한 심층 분석을 수행하는 것이 매우 쉽습니다.

공유 평가 표준

NVIDIA는 Nemotron 3 Nano와 완전한 평가 레시피(모델 카드의 GitHub 링크 참조)를 공개함으로써 커뮤니티에 참고 방법론을 제공합니다. 동일한 구성과 도구를 사용하면 다양한 모델 및 제공업체 간에 벤치마크 선택, 실행 및 해석을 일치시킬 수 있습니다.

오픈소스 도구: NeMo Evaluator

NeMo Evaluator는 여러 하네스에서 수백 개의 벤치마크를 조정합니다, 포함:

  • NeMo Skills – 명령 수행, 도구 사용 및 에이전시 작업.
  • LM Evaluation Harness – 기본 모델 및 사전 학습 벤치마크.

각 하네스는 고유 로직과 데이터셋을 유지하지만, NeMo Evaluator는 구성, 실행 및 로깅을 표준화합니다. 이를 통해 맞춤형 스크립트가 필요 없으며 일관되고 감사 가능한 결과를 얻을 수 있습니다.

오픈 구성

Nemotron 3 Nano 모델 카드에 사용된 정확한 YAML이 공개되어 있습니다. 이 파일은 다음을 지정합니다:

  • 모델 추론 및 배포 설정.
  • 벤치마크 및 작업 선택.
  • 샘플링, 반복 및 프롬프트‑템플릿 파라미터.
  • 런타임 제어(병렬성, 타임아웃, 재시도).
  • 출력 경로 및 아티팩트 레이아웃.

동일한 YAML을 실행하면 동일한 평가 방법론을 보장합니다.

오픈 로그 및 아티팩트

실행 후, 출력 디렉터리는 다음과 같습니다:

results_nvidia_nemotron_3_nano_30b_a3b/
├── artifacts/
│   └── <task_name>/results.json
└── logs/
    └── stdout.log

이 파일들을 통해 사용자는 점수 산출 로직을 검토하고, 예상치 못한 결과를 디버깅하며, 실행 간 결과를 비교할 수 있습니다.

재현 가능 워크플로우

Nemotron 3 Nano의 점수를 재현하려면:

  1. 모델 체크포인트 또는 호스팅 엔드포인트를 확보합니다.
  2. GitHub 저장소에서 공개된 NeMo Evaluator 구성을 가져옵니다.
  3. 단일 CLI 명령(nemo-evaluator-launcher run …)을 실행합니다.
  4. 생성된 로그와 results.json 파일을 검토하고 모델 카드와 비교합니다.

엔드포인트에 접근 가능하고 구성 파일을 적절히 조정하면 동일한 워크플로우를 모든 모델에 적용할 수 있습니다.

평가 스위트 실행

전형적인 실행 예시는 다음과 같습니다:

pip install nemo-evaluator-launcher
export NGC_API_KEY="your-ngc-api-key"
export HF_TOKEN="your-huggingface-token"
export JUDGE_API_KEY="your-judge-api-key"  # only for judge‑based benchmarks

nemo-evaluator-launcher run \
  --config /path/to/examples/nemotron/local_nvidia_nemotron_3_nano_30b_a3b.yaml

--dry-run 또는 limit_samples와 같은 옵션을 사용하면 작업을 미리 보거나 데이터셋을 축소하여 테스트할 수 있습니다.

개별 벤치마크 선택

특정 작업을 실행하려면 -t 플래그를 사용합니다, 예:

# Only MMLU‑Pro
nemo-evaluator-launcher run --config … -t ns_mmlu_pro

# Only coding benchmarks
nemo-evaluator-launcher run --config … -t ns_livecodebench

결과 모니터링 및 검사

nemo-evaluator-launcher status            # job status
nemo-evaluator-launcher logs <job-id>    # stream logs

구조화된 results.json 파일을 통해 Nemotron 3 Nano 모델 카드에 보고된 점수와 직접 비교할 수 있습니다.

작은 점수 변동 해석

재현된 점수와 공개된 숫자 사이에 작은 차이가 발생하는 것은 LLM 추론의 확률적 특성(샘플링, 병렬 실행, 판사 변동성 등) 때문에 예상됩니다. 오픈 평가의 목표는 방법론적 일관성이며, 비트 단위로 동일한 출력을 만드는 것이 아닙니다. 유효한 재현을 보장하려면 다음을 확인하십시오:

  • YAML 구성이 공개된 버전과 일치하는지.
  • 동일한 벤치마크 버전과 프롬프트 템플릿을 사용했는지.
  • 의도한 모델 엔드포인트와 채팅 템플릿을 선택했는지.
  • 런타임 파라미터(반복 횟수, 병렬성, 타임아웃)가 변경되지 않았는지.
  • 모든 아티팩트와 로그가 존재하고 올바르게 구조화되었는지.

이 조건이 충족되면 재현된 결과는 참고 방법론을 충실히 반영한 것입니다.

AI 커뮤니티에 대한 시사점

Nemotron 3 Nano 오픈 평가 패키지는 대형 언어 모델에 대한 투명하고 재현 가능한 벤치마킹을 위한 실용적인 경로를 보여줍니다. 평가 파이프라인의 모든 구성 요소를 공개함으로써 NVIDIA는 다음을 가능하게 합니다:

  • 주장된 성능에 대한 독립적인 검증.
  • 제공업체 간 공정하고 동일 조건의 모델 비교.
  • 연구 및 프로덕션을 위한 확장 가능한 자동 평가 파이프라인.
  • 커뮤니티가 벤치마크 카탈로그를 확장하도록 기여.

이 접근 방식은 개별 점수에서 평가 프로세스 자체의 신뢰성으로 초점을 이동시킵니다.

직접 시작하기

  1. NeMo Evaluator 저장소를 클론합니다.
  2. nano-v3-reproducibility.md 예제의 단계별 튜토리얼을 따라합니다.
  3. 평가하려는 모델(호스팅 또는 자체 제공)로 구성을 지정합니다.
  4. 스위트를 실행하고, 구조화된 출력을 검토한 뒤, 결과를 공유합니다.

결론

NVIDIA가 Nemotron 3 Nano와 완전한 오픈소스 평가 레시피를 공개한 것은 LLM 벤치마킹을 위한 공유되고 감사 가능한 표준을 향한 중요한 단계입니다. NeMo Evaluator 라이브러리를 사용하면 추론 백엔드와 무관하게 이질적인 벤치마크를 일관되게 실행하고, 구성, 로그 및 결과의 전체 출처 추적을 유지할 수 있습니다. 이러한 투명성은 연구자와 개발자가 주장을 검증하고, 모델을 신뢰성 있게 비교하며, 휠을 다시 만들지 않고도 대규모 평가 파이프라인을 구축하도록 돕습니다.

커뮤니티에 참여하세요 – 새로운 벤치마크를 기여하고, 이슈를 보고하거나, 개선안을 NeMo Evaluator GitHub repository에서 제안하십시오.

Sources