NVIDIA Nemotron 3 Nano 开放评估配方与 NeMo Evaluator

简要概述

NVIDIA 发布了 300 亿参数的 Nemotron 3 Nano A3B 模型,并提供了基于 NeMo Evaluator 库的完全开放评估配方,使任何人都能够复现其基准分数并审计评估流水线的每一步。

开放评估为何重要

开放评估消除可能导致报告分数被夸大或低估的隐藏变量。通过公开精确的配置文件、推理设置、日志和制品布局,NVIDIA 使得人们能够验证模型的性能是体现真实能力,还是仅仅经过调优的基准设置。

单一且一致的评估系统

NeMo Evaluator 提供统一的接口来定义基准、提示、运行时参数和推理后端。相同的 YAML 配置可以在不同模型发布之间复用,防止潜在的静默更改导致纵向比较失效。

与推理设置无关的方法论

NeMo Evaluator 将评估工作流与推理引擎分离。无论模型是通过 NVIDIA 的托管端点、Hugging Face Inference API、OpenRouter,还是本地部署访问,均使用相同的评估定义,从而确保在基础设施变更时结果可比。

超越一次性实验的规模化

NeMo Evaluator 中的启动器、制品布局和配置模型专为重复的大规模运行而设计。团队可以从单一基准验证扩展到完整的模型卡套件,而无需重写脚本,从而在时间上保持方法论的一致性。

通过结构化制品和日志实现可审计性

每次运行会自动生成:

  • 每个任务的 results.json 文件,包含原始分数。
  • 用于调试的完整执行日志。
  • 确定性的目录层级(artifacts/logs/)。

这些制品使得追踪最终数值的来源以及对模型行为进行更深入分析变得轻而易举。

共享的评估标准

通过发布 Nemotron 3 Nano 及其 完整评估配方(请参阅模型卡中的 GitHub 链接),NVIDIA 为社区提供了参考方法。使用相同的配置和工具,使不同模型和提供商之间的基准选择、执行和解释保持一致。

开源工具:NeMo Evaluator

NeMo Evaluator 协调来自多个 harness 的数百个基准,包括:

  • NeMo Skills – 指令遵循、工具使用和代理任务。
  • LM Evaluation Harness – 基础模型和预训练基准。

每个 harness 保持其原生逻辑和数据集,而 NeMo Evaluator 标准化配置、执行和日志记录。这消除了对定制脚本的需求,并产生一致、可审计的结果。

开放配置

Nemotron 3 Nano 模型卡使用的确切 YAML 已公开。它指定了:

  • 模型推理和部署设置。
  • 基准和任务选择。
  • 采样、重复和提示模板参数。
  • 运行时控制(并行度、超时、重试)。
  • 输出路径和制品布局。

使用相同的 YAML 可保证评估方法完全一致。

开放日志和制品

执行后,输出目录包含:

results_nvidia_nemotron_3_nano_30b_a3b/
├── artifacts/
│   └── <task_name>/results.json
└── logs/
    └── stdout.log

这些文件让用户能够检查评分逻辑、调试意外结果,并在不同运行之间进行结果比较。

可复现性工作流

要复现 Nemotron 3 Nano 的分数:

  1. 获取模型检查点或托管端点。
  2. 从 GitHub 仓库拉取已发布的 NeMo Evaluator 配置。
  3. 执行单个 CLI 命令(nemo-evaluator-launcher run …)。
  4. 检查生成的日志和 results.json 文件,并与模型卡进行比较。

相同的工作流适用于任何模型,只要端点可访问且相应地调整配置。

运行评估套件

典型的运行如下:

pip install nemo-evaluator-launcher
export NGC_API_KEY="your-ngc-api-key"
export HF_TOKEN="your-huggingface-token"
export JUDGE_API_KEY="your-judge-api-key"  # only for judge‑based benchmarks

nemo-evaluator-launcher run \
  --config /path/to/examples/nemotron/local_nvidia_nemotron_3_nano_30b_a3b.yaml

诸如 --dry-runlimit_samples 等选项可用于预览作业或使用缩减的数据集进行测试。

选择单个基准

使用 -t 标志运行特定任务,例如:

# Only MMLU‑Pro
nemo-evaluator-launcher run --config … -t ns_mmlu_pro

# Only coding benchmarks
nemo-evaluator-launcher run --config … -t ns_livecodebench

监控与检查结果

监控和检查结果的命令示例:

nemo-evaluator-launcher status            # job status
nemo-evaluator-launcher logs <job-id>    # stream logs

结构化的 results.json 文件可直接与 Nemotron 3 Nano 模型卡中报告的分数进行比较。

解释细微分数差异

由于大语言模型推理的随机性(采样、并行执行、评审变动等),复现的分数与已发布的数值之间出现小幅差异是预期的。开放评估的目标是 方法论的一致性,而非位级相同的输出。为确保复现有效,请核实:

  • YAML 配置与已发布的版本一致。
  • 使用相同的基准版本和提示模板。
  • 选择了预期的模型端点和聊天模板。
  • 运行时参数(重复次数、并行度、超时)未更改。
  • 所有制品和日志均存在且结构正确。

只要满足这些条件,复现的结果即忠实呈现参考方法论。

对 AI 社区的影响

Nemotron 3 Nano 开放评估套件展示了一条实现大语言模型透明、可复现基准测试的实用路径。通过公开评估流水线的每个组件,NVIDIA 实现了:

  • 对声称性能的独立验证。
  • 跨提供商的公平、可比的模型比较。
  • 用于研究和生产的可扩展、自动化评估流水线。
  • 社区贡献以扩展基准目录。

这种方法将关注点从孤立的分数转向 评估过程本身的可信度

自行入门

  1. 克隆 NeMo Evaluator 仓库。
  2. 按照 nano-v3-reproducibility.md 示例中的一步步教程操作。
  3. 将配置指向您希望评估的任意模型(托管或自部署)。
  4. 运行套件,检查结构化输出,并分享您的发现。

结论

NVIDIA 发布 Nemotron 3 Nano 并提供完整的开源评估配方,标志着在 LLM 基准测试方面迈向共享、可审计标准的重要一步。NeMo Evaluator 库使得无论推理后端如何,都能一致地运行多样化基准,并保留配置、日志和结果的完整溯源。这种透明性使研究者和开发者能够验证声明、可靠地比较模型,并在不重复造轮子的情况下构建更大规模的评估流水线。

加入社区 —— 在 NeMo Evaluator GitHub 仓库 贡献新基准、报告问题或提出改进。

Sources