NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性

NVIDIA Nemotron 3 Nano Omni 发布说明 / 新特性

NVIDIA 推出了 Nemotron 3 Nano Omni,这是一款全模态理解模型,专为现实世界的文档分析、自动语音识别 (ASR)、长音频-视频理解、智能体计算机使用以及通用多模态推理而设计。该模型通过将文本、图像、视频和音频能力集成到单个系统中,扩展了 Nemotron 多模态系列,能够处理极长的多模态上下文。

核心能力与应用场景

Nemotron 3 Nano Omni 针对五类主要工作负载进行了优化:

  • 现实世界文档分析: 该模型可处理 100 多页的文档,专注于处理合同和技术论文等复杂材料中的布局、表格、图表、公式和跨页引用。
  • 自动语音识别 (ASR): 它在多种音频条件下提供高质量的转录,包括具有不同口音和背景噪音的长音频。
  • 长音频-视频理解: 该模型可以对混合的音频和视觉证据进行联合推理,例如带有旁白的屏幕录制或会议存档。
  • 智能体计算机使用: 专门针对 GUI 环境进行训练,该模型可以解释屏幕截图、监控 UI 状态,并协助执行动作选择和工作流自动化。
  • 通用多模态推理: 它能够综合长上下文窗口和多种模态的信息,执行多步推理和计算。

技术架构

Nemotron 3 Nano Omni 采用统一的 encoder-projector-decoder 设计。语言骨干网络是 Nemotron 3 Nano 30B-A3B,它与 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器配对。这些编码器通过轻量级的 2 层 MLP projector 连接到 LLM 骨干网络。

Hybrid Mamba-Transformer-MoE 骨干网络

为了在扩展到长多模态上下文的同时保持推理性能,该骨干网络交织了三个组件:

  • 23 个 Mamba selective state-space layers,用于高效的长上下文处理。
  • 23 个 MoE layers(128 个专家,top-6 路由,以及一个共享专家),用于条件容量。
  • 6 个 grouped-query attention layers,以保留全局交互和表达能力。

视觉与视频创新

  • 动态分辨率: 该模型取代了分块(tiling)技术,采用原生长宽比的动态分辨率处理,每张图像使用 1,024 到 13,312 个视觉 patch。这对于重度依赖 OCR 的文档和 GUI 布局至关重要。
  • Conv3D 时间压缩: 对于视频,专用的 Conv3D tubelet embedding 路径将连续的两帧融合为一个单一的 tubelet,使语言模型需要关注的视觉 token 减半。
  • 高效视频采样 (EVS): 这项推理时特性在保持视频变化处动态 token 的同时,丢弃冗余的静态视频 token,从而进一步降低延迟并提高吞吐量。

原生音频集成

由 Parakeet-TDT-0.6B-v2 提供支持,该模型处理采样率为 16 kHz 的音频。其训练输入长达 1,200 秒(20 分钟),而 LLM 的最大上下文长度支持超过 5 小时的音频。音频、视觉和文本 token 在共享的多模态序列中交织并进行联合处理。

性能与基准测试

Nemotron 3 Nano Omni 相比 Nemotron Nano V2 VL 有显著提升,并在多个领域超越了 Qwen3-Omni 30B-A3B:

任务 基准测试 Nemotron 3 Nano Omni Nemotron Nano V2 VL Qwen3-Omni 30B-A3B
文档理解 OCRBenchV2-En 65.8 61.2 -
MMLongBench-Doc 57.5 38.0 49.5
CharXiv reasoning 63.6 41.3 61.1
GUI ScreenSpot-Pro 57.8 5.5 59.7
OSWorld 47.4 11.0 29.0
视频理解 Video-MME 72.2 63.0 70.5
视频 + 音频理解 WorldSense 55.4 - 54.0
DailyOmni 74.1 - 73.6
语音交互 VoiceBench 89.4 - 88.8
ASR HF Open ASR 5.95 - 6.55

在效率方面,与具有类似交互性的其他开源全模态模型相比,Nemotron 3 Nano Omni 在多文档使用场景下的系统效率提高了 7.4 倍,在视频使用场景下的系统效率提高了 9.2 倍。

训练与数据基础设施

训练是在 NVIDIA H100 节点(规模从 32 到 128)上使用 Megatron-LM、Transformer Engine 和 Megatron Energon 进行的。SFT 后的强化学习由 NeMo-RL 和 NeMo Gym 在 B200 和 H100 集群上处理。

强化学习 (RL)

  • 文本 RL: 评估模型执行工具调用、代码编写和多部分规划的能力。
  • Omni RL: 训练模型跨图像、视频、音频和文本进行推理。验证器套件包括不可回答的案例,以教导模型在证据不足以防止幻觉时放弃回答。

合成数据生成

NVIDIA 使用 NeMo Data Designer 从现实世界的 PDF 中生成了约 11.4M 个合成 QA 对(约 45B tokens)以加强长上下文文档推理,从而使 MMLongBench-Doc 的准确率提高了 2.19 倍。

可用性

检查点(Checkpoints)已在 Hugging Face 上以 BF16、FP8 和 NVFP4 格式提供。技术报告可在 arXiv (2604.24954) 上查阅。

Sources