NVIDIA Nemotron 后训练数据集 v2 与 Nemotron Nano 2 9B 发布
NVIDIA 已发布 Nemotron 后训练数据集 v2,这是一套包含 600 万多语言推理示例的集合,同时发布了 Nemotron Nano 2 9B 模型。此发布旨在通过提供高质量的训练数据和一款高效的边缘可用模型,配备可配置的思考预算,以在准确性和成本之间取得平衡,来支持开源权重模型生态系统。
Nemotron Nano 2 9B 模型规格
Nemotron Nano 2 9B 旨在用于边缘和 RTX 部署,特别面向分析副驾驶、支持聊天机器人和客服代理。
技术架构与性能
- Hybrid Architecture: 该模型采用混合 Transformer–Mamba 架构(将 Mamba-2 与有限数量的注意力层相结合),相较于仅使用 Transformer 的同等规模模型,可实现更高的吞吐量。
- Throughput: 该模型的 token 生成吞吐量最高可比同类 9B 参数规模的其他领先模型提升 6 倍。
- Cost Optimization: 可配置的 “thinking budget” 让用户能够控制使用的推理 token 数量,进而将推理成本降低最高可达 60%。
- Licensing: 该模型在
nvidia-open-model-license下发布。
Nemotron 后训练数据集 v2 构建
Nemotron 后训练数据集 v2 包含 600 万推理示例,这些示例由原始英文推理数据翻译成五种目标语言:法语、西班牙语、德语、意大利语和日语。
翻译方法论
为了利用预训练期间获得的英文知识,NVIDIA 在翻译用户提示和模型响应时保留了原始的英文推理链。翻译过程对德语使用了 Qwen2.5-32B-Instruct-AWQ,对其他语言使用了 Qwen2.5-14B-Instruct,选择它们是因为其质量可靠、采用开放的 Apache 2.0 许可证,并且能够在单块 A100 GPU 上运行。
质量控制与幻觉缓解
NVIDIA 发现,与标准机器翻译数据集相比,LLM 在翻译 SFT(监督微调)数据集时更容易产生幻觉,并且随着输入长度的增加,质量会下降。为缓解此问题,实施了以下机制:
- Line-by-Line Translation: 将句子按换行符拆分;不可翻译的行(如制表符)和代码块保持原样,不进行翻译。
- Format Enforcement: 翻译必须用特定的括号(– –)包裹;不符合此格式的示例将被丢弃。
- Language Identification: 使用
fastText语言识别工具对提示输入进行过滤,以剔除非目标语言数据。此过程共移除 55,567 条示例(约占所有多语言示例的 1.1%)。
按格式强制导致的数据丢弃率
下表详细列出了因强制输出格式而被丢弃的数据比例(以字节计):
| 语言 | 代码 | 问答 | 数学 |
|---|---|---|---|
| 德语 (de) | 2.28% | 1.11% | 2.47% |
| 西班牙语 (es) | 26.14% | 5.15% | 6.38% |
| 法语 (fr) | 11.01% | 1.37% | 1.96% |
| 意大利语 (it) | 4.94% | 1.36% | 0.75% |
| 日语 (ja) | 7.68% | 2.51% | 3.86% |
可用性
Nemotron 后训练数据集 v2 可在 Hugging Face 上获取。Nemotron Nano 2 9B 模型权重也托管在 Hugging Face,端点可通过 build.nvidia.com 访问,并作为 NVIDIA NIM 提供,以满足低延迟、高吞吐的需求.