NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性
NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性
NVIDIA 推出了 Nemotron 3 Nano Omni,这是一款全模态理解模型,专为现实世界的文档分析、自动语音识别 (ASR)、长音频-视频理解、智能体计算机使用以及通用多模态推理而设计。该模型通过将文本、图像、视频和音频能力集成到单个系统中,扩展了 Nemotron 多模态系列,能够处理极长的多模态上下文。
核心能力与应用场景
Nemotron 3 Nano Omni 针对五类主要工作负载进行了优化:
- 现实世界文档分析: 该模型可处理 100 多页的文档,专注于处理合同和技术论文等复杂材料中的布局、表格、图表、公式和跨页引用。
- 自动语音识别 (ASR): 它在多种音频条件下提供高质量的转录,包括具有不同口音和背景噪音的长音频。
- 长音频-视频理解: 该模型可以对混合的音频和视觉证据进行联合推理,例如带有旁白的屏幕录制或会议存档。
- 智能体计算机使用: 专门针对 GUI 环境进行训练,该模型可以解释屏幕截图、监控 UI 状态,并协助执行动作选择和工作流自动化。
- 通用多模态推理: 它能够综合长上下文窗口和多种模态的信息,执行多步推理和计算。
技术架构
Nemotron 3 Nano Omni 采用统一的 encoder-projector-decoder 设计。语言骨干网络是 Nemotron 3 Nano 30B-A3B,它与 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器配对。这些编码器通过轻量级的 2 层 MLP projector 连接到 LLM 骨干网络。
Hybrid Mamba-Transformer-MoE 骨干网络
为了在扩展到长多模态上下文的同时保持推理性能,该骨干网络交织了三个组件:
- 23 个 Mamba selective state-space layers,用于高效的长上下文处理。
- 23 个 MoE layers(128 个专家,top-6 路由,以及一个共享专家),用于条件容量。
- 6 个 grouped-query attention layers,以保留全局交互和表达能力。
视觉与视频创新
- 动态分辨率: 该模型取代了分块(tiling)技术,采用原生长宽比的动态分辨率处理,每张图像使用 1,024 到 13,312 个视觉 patch。这对于重度依赖 OCR 的文档和 GUI 布局至关重要。
- Conv3D 时间压缩: 对于视频,专用的 Conv3D tubelet embedding 路径将连续的两帧融合为一个单一的 tubelet,使语言模型需要关注的视觉 token 减半。
- 高效视频采样 (EVS): 这项推理时特性在保持视频变化处动态 token 的同时,丢弃冗余的静态视频 token,从而进一步降低延迟并提高吞吐量。
原生音频集成
由 Parakeet-TDT-0.6B-v2 提供支持,该模型处理采样率为 16 kHz 的音频。其训练输入长达 1,200 秒(20 分钟),而 LLM 的最大上下文长度支持超过 5 小时的音频。音频、视觉和文本 token 在共享的多模态序列中交织并进行联合处理。
性能与基准测试
Nemotron 3 Nano Omni 相比 Nemotron Nano V2 VL 有显著提升,并在多个领域超越了 Qwen3-Omni 30B-A3B:
| 任务 | 基准测试 | Nemotron 3 Nano Omni | Nemotron Nano V2 VL | Qwen3-Omni 30B-A3B |
|---|---|---|---|---|
| 文档理解 | OCRBenchV2-En | 65.8 | 61.2 | - |
| MMLongBench-Doc | 57.5 | 38.0 | 49.5 | |
| CharXiv reasoning | 63.6 | 41.3 | 61.1 | |
| GUI | ScreenSpot-Pro | 57.8 | 5.5 | 59.7 |
| OSWorld | 47.4 | 11.0 | 29.0 | |
| 视频理解 | Video-MME | 72.2 | 63.0 | 70.5 |
| 视频 + 音频理解 | WorldSense | 55.4 | - | 54.0 |
| DailyOmni | 74.1 | - | 73.6 | |
| 语音交互 | VoiceBench | 89.4 | - | 88.8 |
| ASR | HF Open ASR | 5.95 | - | 6.55 |
在效率方面,与具有类似交互性的其他开源全模态模型相比,Nemotron 3 Nano Omni 在多文档使用场景下的系统效率提高了 7.4 倍,在视频使用场景下的系统效率提高了 9.2 倍。
训练与数据基础设施
训练是在 NVIDIA H100 节点(规模从 32 到 128)上使用 Megatron-LM、Transformer Engine 和 Megatron Energon 进行的。SFT 后的强化学习由 NeMo-RL 和 NeMo Gym 在 B200 和 H100 集群上处理。
强化学习 (RL)
- 文本 RL: 评估模型执行工具调用、代码编写和多部分规划的能力。
- Omni RL: 训练模型跨图像、视频、音频和文本进行推理。验证器套件包括不可回答的案例,以教导模型在证据不足以防止幻觉时放弃回答。
合成数据生成
NVIDIA 使用 NeMo Data Designer 从现实世界的 PDF 中生成了约 11.4M 个合成 QA 对(约 45B tokens)以加强长上下文文档推理,从而使 MMLongBench-Doc 的准确率提高了 2.19 倍。
可用性
检查点(Checkpoints)已在 Hugging Face 上以 BF16、FP8 和 NVFP4 格式提供。技术报告可在 arXiv (2604.24954) 上查阅。