NVIDIA Nemotron 3 Nano Omni 在 vLLM 中的支持
vLLM 现在支持 NVIDIA Nemotron 3 Nano Omni,这是一款开放的多模态模型,旨在通过将视觉、音频和语言推理统一到单一高效循环中,为代理式 AI 提供动力。此集成使开发者能够部署一种模型,取代碎片化的多模态堆栈——通常需要将视觉、语音和语言的独立模型拼接在一起——从而减少推理跳数、编排开销和上下文碎片化。
统一多模态架构
Nemotron 3 Nano Omni 将独立的感知模型合并为单一推理循环,能够同时处理文本、图像、视频和音频输入。该架构专为需要持续感知屏幕、文档和视音频流的企业代理工作流而设计。
技术规格
- 架构: 专家混合(MoE)与混合 Transformer‑Mamba 架构。
- 模型规模: 总计 30B 参数,每次前向传播仅激活 3B 参数。
- 上下文长度: 256K 令牌。
- 时序处理: 使用 3D 卷积层(Conv3D)高效处理视频中的时空数据。
- 模态: 支持文本、图像、视频和音频作为输入,输出为文本。
性能与效率提升
Nemotron 3 Nano Omni 相较于其他开放 omni 模型及之前的迭代,提供了显著更高的吞吐量和更低的计算成本。
吞吐量与可扩展性
模型在相同交互水平下的吞吐量是其他开放 omni 模型的 9 倍。具体在固定的每用户交互阈值下,模型表现为:
- 视频使用场景: 吞吐量提升 9.2 倍。
- 多文档使用场景: 吞吐量提升 7.4 倍。
计算效率
为在不产生高额成本的前提下保持高性能,模型采用了多项优化技术:
- 高效视频采样(EVS): 通过时序感知,在相同计算预算下处理更长视频。
- 量化支持: 支持 BF16、FP8 和 NVFP4 精度,加速推理并在同一 GPU 上提升请求容量。
- 硬件兼容性: 针对 NVIDIA B200、H100、H200、A100、L40S、DGX Spark 和 RTX 6000 GPU 进行优化。
多模态智能与准确性
Nemotron 3 Nano Omni 在多模态推理准确性方面相较于之前的 Nemotron Nano VL V2 模型有显著提升,在六大行业排行榜中均取得领先位置。
基准测试成功
模型在多个专业类别中领先:
- 文档智能: 在 MMlongbench‑Doc 和 OCRBenchV2 上表现最佳。
- 视频与音频理解: 在 WorldSense、DailyOmni 和 VoiceBench 上取得领先结果。
- MediaPerf: 在所有任务中实现最高吞吐量,并在视频级标记上实现最低推理成本。
训练方法论
准确性的提升源于使用 NVIDIA NeMo RL 与 NeMo Gym 在文本、图像、音频和视频环境中的多环境强化学习,这提升了指令遵循能力并加速了多模态答案的收敛。
使用 vLLM 部署
Nemotron 3 Nano Omni 可通过 vLLM 提供的兼容 OpenAI 的 API 进行服务。部署需要 vllm[audio]==0.20.0,并支持视频裁剪和自动工具选择等高级配置。
示例服务器命令
python3 -m vllm.entrypoints.openai.api_server \
--model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
--served-model-name nemotron \
--trust-remote-code \
--dtype auto \
--host 0.0.0.0 \
--port 5000 \
--tensor-parallel-size 1 \
--max-model-len 131072 \
--media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
--video-pruning-rate 0.5 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser nemotron_v3