NVIDIA Nemotron 3 Nano 開放評估配方與 NeMo Evaluator
TL;DR
NVIDIA 發布了 30 億參數的 Nemotron 3 Nano A3B 模型,並提供了基於 NeMo Evaluator 函式庫的完整開放評估配方,使任何人都能重現其基準分數並審核評估流程的每一步。
為什麼開放評估很重要
開放評估消除會抬高或降低報告分數的隱藏變數。透過公開完整的設定檔、推論設定、日誌與產出檔案結構,NVIDIA 讓人們能驗證模型效能是源於真實能力,還是僅僅因為調校過的基準設定。
單一且一致的評估系統
NeMo Evaluator 提供統一介面,用於定義基準、提示、執行時參數與推論後端。相同的 YAML 設定可在不同模型版本間重複使用,避免因靜默變更而破壞長期比較。
與推論設定無關的方法論
NeMo Evaluator 將評估工作流程與推論引擎分離。無論模型是透過 NVIDIA 托管端點、Hugging Face Inference API、OpenRouter,或是本地部署存取,同一套評估定義皆適用,確保在基礎設施變更時仍能得到可比的結果。
超越一次性實驗的擴展性
NeMo Evaluator 中的啟動器、產出檔案布局與設定模型皆為可重複、 大規模執行而設計。團隊可以從單一基準驗證,擴展到完整的模型卡套件,而不必重寫腳本,從而在時間上保持方法論的一致性。
可稽核的結構化產出與日誌
每次執行都會自動產生:
- 每個任務的
results.json檔案,內含原始分數。 - 用於除錯的完整執行日誌。
- 確定性的目錄層級 (
artifacts/與logs/)。
這些產出讓追溯最終數值的產生過程變得輕而易舉,也方便對模型行為進行更深入的分析。
共享的評估標準
透過釋出 Nemotron 3 Nano 及其 完整評估配方(請參閱模型卡中的 GitHub 連結),NVIDIA 為社群提供參考方法。使用相同的設定與工具,可在不同模型與供應商之間對基準的選取、執行與解讀保持一致。
開源工具:NeMo Evaluator
NeMo Evaluator 協調來自多個 harness 的數百項基準,包括:
- NeMo Skills – 指令遵循、工具使用與代理任務。
- LM Evaluation Harness – 基礎模型與預訓練基準。
每個 harness 保留其原生邏輯與資料集,同時 NeMo Evaluator 統一了設定、執行與日誌記錄。這消除了自行撰寫腳本的需求,並產出一致且可稽核的結果。
開放的設定檔
Nemotron 3 Nano 模型卡所使用的完整 YAML 已公開。它說明了:
- 模型推論與部署設定。
- 基準與任務的選取。
- 抽樣、重複與提示模板參數。
- 執行時控制(平行度、逾時、重試次數)。
- 輸出路徑與產出檔案布局。
使用相同的 YAML 即可保證評估方法的一致性。
開放的日誌與產出
執行完畢後,輸出目錄會包含:
results_nvidia_nemotron_3_nano_30b_a3b/
├── artifacts/
│ └── <task_name>/results.json
└── logs/
└── stdout.log
這些檔案讓使用者能檢視計分邏輯、除錯意外結果,並在不同執行之間比較結果。
可重現性工作流程
要重現 Nemotron 3 Nano 的分數,請:
- 取得模型檢查點或托管端點。
- 從 GitHub 倉庫取得已發布的 NeMo Evaluator 設定檔。
- 執行單一 CLI 指令(
nemo-evaluator-launcher run …)。 - 檢查產生的日誌與
results.json檔案,並與模型卡比較。
相同的工作流程適用於任何模型,只要端點可達且相應調整設定即可。
執行評估套件
典型的執行方式如下:
pip install nemo-evaluator-launcher
export NGC_API_KEY="your-ngc-api-key"
export HF_TOKEN="your-huggingface-token"
export JUDGE_API_KEY="your-judge-api-key" # 只用於基於 judge 的基準
nemo-evaluator-launcher run \
--config /path/to/examples/nemotron/local_nvidia_nemotron_3_nano_30b_a3b.yaml
--dry-run 或 limit_samples 等選項可用於預覽工作或以較小資料集測試。
選取單一基準
使用 -t 旗標執行特定任務,例如:
# 只跑 MMLU‑Pro
nemo-evaluator-launcher run --config … -t ns_mmlu_pro
# 只跑程式碼基準
nemo-evaluator-launcher run --config … -t ns_livecodebench
監控與檢視結果
nemo-evaluator-launcher status # 工作狀態
nemo-evaluator-launcher logs <job-id> # 串流日誌
結構化的 results.json 檔案可直接與 Nemotron 3 Nano 模型卡中報告的分數進行比對。
解讀細微分數差異
由於大型語言模型推論的隨機性(抽樣、平行執行、judge 變異等),重現分數與公布數字之間出現小幅差異是正常的。開放評估的目標是 方法論的一致性,而非位元層面的完全相同。為確保重現有效,請確認:
- YAML 設定與發布版本相符。
- 使用相同的基準版本與提示模板。
- 選擇正確的模型端點與聊天模板。
- 執行時參數(重複次數、平行度、逾時)未變更。
- 所有產出與日誌皆完整且結構正確。
只要上述條件成立,重現的結果即忠實呈現參考方法。
對 AI 社群的影響
Nemotron 3 Nano 的開放評估套件展示了一條實務路徑,讓大型語言模型的基準測試變得透明且可重現。透過公開評估流程的每個組件,NVIDIA 使得:
- 獨立驗證聲稱的效能。
- 在不同供應商間進行公平、蘋果對蘋果的模型比較。
- 為研究與生產提供可擴展、自動化的評估管線。
- 社群能貢獻新基準、回報問題或提出改進。
此做法將焦點從孤立的分數轉移到 評估過程的可信度 本身。
自行上手
- Clone NeMo Evaluator 倉庫。
- 依照
nano-v3-reproducibility.md範例完成一步步教學。 - 將設定指向任意想要評估的模型(托管或自行部署)。
- 執行整套測試,檢視結構化輸出,並分享你的發現。
結論
NVIDIA 釋出 Nemotron 3 Nano 並提供完整、開源的評估配方,標誌著 LLM 基準測試向共享、可稽核標準邁進的重要一步。NeMo Evaluator 函式庫讓不同推論後端下的異質基準得以一致執行,並保留完整的設定、日誌與結果溯源。此透明度賦予研究者與開發者驗證聲稱、可靠比較模型、以及在不必重新發明輪子的情況下構建大規模評估管線的能力。
加入社群 – 在 NeMo Evaluator GitHub repository 上貢獻新基準、回報問題或提出改進。