NVIDIA Nemotron 后训练数据集 v2 与 Nemotron Nano 2 9B 发布

NVIDIA 已发布 Nemotron 后训练数据集 v2,这是一套包含 600 万多语言推理示例的集合,同时发布了 Nemotron Nano 2 9B 模型。此发布旨在通过提供高质量的训练数据和一款高效的边缘可用模型,配备可配置的思考预算,以在准确性和成本之间取得平衡,来支持开源权重模型生态系统。

Nemotron Nano 2 9B 模型规格

Nemotron Nano 2 9B 旨在用于边缘和 RTX 部署,特别面向分析副驾驶、支持聊天机器人和客服代理。

技术架构与性能

  • Hybrid Architecture: 该模型采用混合 Transformer–Mamba 架构(将 Mamba-2 与有限数量的注意力层相结合),相较于仅使用 Transformer 的同等规模模型,可实现更高的吞吐量。
  • Throughput: 该模型的 token 生成吞吐量最高可比同类 9B 参数规模的其他领先模型提升 6 倍。
  • Cost Optimization: 可配置的 “thinking budget” 让用户能够控制使用的推理 token 数量,进而将推理成本降低最高可达 60%。
  • Licensing: 该模型在 nvidia-open-model-license 下发布。

Nemotron 后训练数据集 v2 构建

Nemotron 后训练数据集 v2 包含 600 万推理示例,这些示例由原始英文推理数据翻译成五种目标语言:法语、西班牙语、德语、意大利语和日语。

翻译方法论

为了利用预训练期间获得的英文知识,NVIDIA 在翻译用户提示和模型响应时保留了原始的英文推理链。翻译过程对德语使用了 Qwen2.5-32B-Instruct-AWQ,对其他语言使用了 Qwen2.5-14B-Instruct,选择它们是因为其质量可靠、采用开放的 Apache 2.0 许可证,并且能够在单块 A100 GPU 上运行。

质量控制与幻觉缓解

NVIDIA 发现,与标准机器翻译数据集相比,LLM 在翻译 SFT(监督微调)数据集时更容易产生幻觉,并且随着输入长度的增加,质量会下降。为缓解此问题,实施了以下机制:

  • Line-by-Line Translation: 将句子按换行符拆分;不可翻译的行(如制表符)和代码块保持原样,不进行翻译。
  • Format Enforcement: 翻译必须用特定的括号(– –)包裹;不符合此格式的示例将被丢弃。
  • Language Identification: 使用 fastText 语言识别工具对提示输入进行过滤,以剔除非目标语言数据。此过程共移除 55,567 条示例(约占所有多语言示例的 1.1%)。

按格式强制导致的数据丢弃率

下表详细列出了因强制输出格式而被丢弃的数据比例(以字节计):

语言 代码 问答 数学
德语 (de) 2.28% 1.11% 2.47%
西班牙语 (es) 26.14% 5.15% 6.38%
法语 (fr) 11.01% 1.37% 1.96%
意大利语 (it) 4.94% 1.36% 0.75%
日语 (ja) 7.68% 2.51% 3.86%

可用性

Nemotron 后训练数据集 v2 可在 Hugging Face 上获取。Nemotron Nano 2 9B 模型权重也托管在 Hugging Face,端点可通过 build.nvidia.com 访问,并作为 NVIDIA NIM 提供,以满足低延迟、高吞吐的需求.

Sources