NVIDIA Nemotron 後訓練資料集 v2 與 Nemotron Nano 2 9B 發布

NVIDIA 已發布 Nemotron 後訓練資料集 v2,這是一個包含 600 萬多語言推理範例的集合,並同步推出 Nemotron Nano 2 9B 模型。此發布旨在透過提供高品質的訓練資料與具可配置思考預算的高效邊緣模型,支援開放權重模型生態系,平衡準確度與成本。

Nemotron Nano 2 9B 模型規格

Nemotron Nano 2 9B 專為邊緣與 RTX 部署而設計,特別針對分析副駕、支援聊天機器人與客服代理。

技術架構與效能

  • Hybrid Architecture: 模型使用混合 Transformer–Mamba 架構(結合 Mamba-2 與有限數量的注意力層),相較於僅使用 Transformer 的同等規模模型,可實現更高的吞吐量。
  • Throughput: 該模型的 token 生成吞吐量最高可達同類 9B 參數規模領先模型的 6 倍。
  • Cost Optimization: 可配置的「思考預算」讓使用者能控制使用的推理 token 數量,從而將推理成本降低最高達 60%。
  • Licensing: 模型以 nvidia-open-model-license 發布。

Nemotron 後訓練資料集 v2 建構

Nemotron 後訓練資料集 v2 包含 600 萬推理範例,這些範例由原始英文推理資料翻譯成五種目標語言:法文、西班牙文、德文、義大利文與日文。

翻譯方法論

為了利用預訓練期間獲得的英文知識,NVIDIA 在翻譯使用者提示與模型回應時保留了原始英文推理鏈。翻譯過程使用 Qwen2.5-32B-Instruct-AWQ 處理德文,其他語言則使用 Qwen2.5-14B-Instruct,此兩者因具備穩健的品質、開放的 Apache 2.0 授權,以及能在單張 A100 GPU 上執行的特性而被選用。

品質控制與幻覺減輕

NVIDIA 發現相較於標準機器翻譯資料集,LLM 在翻譯 SFT(監督式微調)資料集時更容易產生幻覺,且隨著輸入長度增加,品質會下降。為減輕此問題,實施了以下機制:

  • Line-by-Line Translation: 句子依換行符號拆分;無法翻譯的行(如制表符)與程式碼區塊會保留原樣,不進行翻譯。
  • Format Enforcement: 翻譯必須以特定括號(– –)包裹;不符合此格式的範例會被丟棄。
  • Language Identification: 使用 fastText 語言辨識工具對提示輸入進行篩選,以剔除非目標語言資料。此過程移除 55,567 個範例(約佔所有多語言範例的 1.1%)。

依格式強制的資料丟棄率

以下表格說明因執行輸出格式強制而被丟棄的資料比例(以位元組計算):

語言 程式碼 問答 數學
德文 (de) 2.28% 1.11% 2.47%
西班牙文 (es) 26.14% 5.15% 6.38%
法文 (fr) 11.01% 1.37% 1.96%
義大利文 (it) 4.94% 1.36% 0.75%
日文 (ja) 7.68% 2.51% 3.86%

可取得性

Nemotron 後訓練資料集 v2 可於 Hugging Face 取得。Nemotron Nano 2 9B 模型權重亦託管於 Hugging Face,端點可透過 build.nvidia.com 以及作為 NVIDIA NIM 供低延遲、高吞吐需求使用。

Sources