NVIDIA Nemotron 3 Nano Omni 在 vLLM 中的支持

vLLM 现在支持 NVIDIA Nemotron 3 Nano Omni,这是一款开放的多模态模型,旨在通过将视觉、音频和语言推理统一到单一高效循环中,为代理式 AI 提供动力。此集成使开发者能够部署一种模型,取代碎片化的多模态堆栈——通常需要将视觉、语音和语言的独立模型拼接在一起——从而减少推理跳数、编排开销和上下文碎片化。

统一多模态架构

Nemotron 3 Nano Omni 将独立的感知模型合并为单一推理循环,能够同时处理文本、图像、视频和音频输入。该架构专为需要持续感知屏幕、文档和视音频流的企业代理工作流而设计。

技术规格

  • 架构: 专家混合(MoE)与混合 Transformer‑Mamba 架构。
  • 模型规模: 总计 30B 参数,每次前向传播仅激活 3B 参数。
  • 上下文长度: 256K 令牌。
  • 时序处理: 使用 3D 卷积层(Conv3D)高效处理视频中的时空数据。
  • 模态: 支持文本、图像、视频和音频作为输入,输出为文本。

性能与效率提升

Nemotron 3 Nano Omni 相较于其他开放 omni 模型及之前的迭代,提供了显著更高的吞吐量和更低的计算成本。

吞吐量与可扩展性

模型在相同交互水平下的吞吐量是其他开放 omni 模型的 9 倍。具体在固定的每用户交互阈值下,模型表现为:

  • 视频使用场景: 吞吐量提升 9.2 倍。
  • 多文档使用场景: 吞吐量提升 7.4 倍。

计算效率

为在不产生高额成本的前提下保持高性能,模型采用了多项优化技术:

  • 高效视频采样(EVS): 通过时序感知,在相同计算预算下处理更长视频。
  • 量化支持: 支持 BF16、FP8 和 NVFP4 精度,加速推理并在同一 GPU 上提升请求容量。
  • 硬件兼容性: 针对 NVIDIA B200、H100、H200、A100、L40S、DGX Spark 和 RTX 6000 GPU 进行优化。

多模态智能与准确性

Nemotron 3 Nano Omni 在多模态推理准确性方面相较于之前的 Nemotron Nano VL V2 模型有显著提升,在六大行业排行榜中均取得领先位置。

基准测试成功

模型在多个专业类别中领先:

  • 文档智能: 在 MMlongbench‑Doc 和 OCRBenchV2 上表现最佳。
  • 视频与音频理解: 在 WorldSense、DailyOmni 和 VoiceBench 上取得领先结果。
  • MediaPerf: 在所有任务中实现最高吞吐量,并在视频级标记上实现最低推理成本。

训练方法论

准确性的提升源于使用 NVIDIA NeMo RL 与 NeMo Gym 在文本、图像、音频和视频环境中的多环境强化学习,这提升了指令遵循能力并加速了多模态答案的收敛。

使用 vLLM 部署

Nemotron 3 Nano Omni 可通过 vLLM 提供的兼容 OpenAI 的 API 进行服务。部署需要 vllm[audio]==0.20.0,并支持视频裁剪和自动工具选择等高级配置。

示例服务器命令

python3 -m vllm.entrypoints.openai.api_server \
    --model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
    --served-model-name nemotron \
    --trust-remote-code \
    --dtype auto \
    --host 0.0.0.0 \
    --port 5000 \
    --tensor-parallel-size 1 \
    --max-model-len 131072 \
    --media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
    --video-pruning-rate 0.5 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

Sources