vLLM 中對 NVIDIA Nemotron 3 Nano Omni 的支援
vLLM 現已支援 NVIDIA Nemotron 3 Nano Omni,這是一個開源的多模態模型,旨在透過將視覺、音訊與語言推理統合於單一高效迴圈來驅動代理式 AI。此整合讓開發者能部署取代傳統碎片化多模態堆疊的模型——通常需要將視覺、語音與語言的獨立模型拼接在一起——從而減少推論跳躍、協調開銷與上下文碎片化。
統一多模態架構
Nemotron 3 Nano Omni 將分散的感知模型合併為單一推理迴圈,能同時處理文字、影像、影片與音訊輸入。此架構專為企業代理工作流程設計,需持續感知螢幕、文件與視聽串流。
技術規格
- 架構: 混合專家 (MoE) 與混合 Transformer‑Mamba 架構。
- 模型大小: 總參數 30B,單次前向僅啟用 3B 參數。
- 上下文長度: 256K 令牌。
- 時間處理: 使用 3D 捲積層 (Conv3D) 高效處理影片的時空資料。
- 模態: 支援文字、影像、影片與音訊作為輸入,文字為輸出。
效能與效率提升
Nemotron 3 Nano Omni 相較於其他開源 omni 模型與先前版本,提供顯著更高的吞吐量與更低的運算成本。
吞吐量與可擴展性
模型在相同互動層級下,達到其他開源 omni 模型的 9 倍吞吐量。具體在固定每位使用者互動門檻下,模型表現為:
- 影片使用情境: 9.2 倍更高的吞吐量。
- 多文件使用情境: 7.4 倍更高的吞吐量。
計算效率
為在不產生成本負擔的前提下維持高效能,模型採用了多項最佳化技術:
- 高效影片抽樣 (EVS): 透過時間感知感知,在相同運算預算下處理更長影片。
- 量化支援: 支援 BF16、FP8 與 NVFP4 精度,加速推論並提升同一 GPU 上的請求容量。
- 硬體相容性: 為 NVIDIA B200、H100、H200、A100、L40S、DGX Spark 與 RTX 6000 GPU 進行最佳化。
多模態智慧與準確性
Nemotron 3 Nano Omni 在多模態推理準確度上較前代 Nemotron Nano VL V2 有顯著提升,於六大產業排行榜中取得領先位置。
基準測試成功
模型在多個專業領域中領先:
- 文件智慧: 在 MMlongbench‑Doc 與 OCRBenchV2 上取得最佳表現。
- 影片與音訊理解: 在 WorldSense、DailyOmni 與 VoiceBench 上取得領先成果。
- MediaPerf: 在所有任務中達到最高吞吐量,且在影片層級標記上擁有最低推論成本。
訓練方法論
準確度提升源自於使用 NVIDIA NeMo RL 與 NeMo Gym 於文字、影像、音訊與影片環境進行的多環境強化學習,增進指令遵循與多模態答案的收斂。
使用 vLLM 部署
Nemotron 3 Nano Omni 可透過 vLLM 以相容 OpenAI 的 API 服務。部署需要 vllm[audio]==0.20.0,並支援影片剪枝與自動工具選擇等進階設定。
範例伺服器指令
python3 -m vllm.entrypoints.openai.api_server \
--model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
--served-model-name nemotron \
--trust-remote-code \
--dtype auto \
--host 0.0.0.0 \
--port 5000 \
--tensor-parallel-size 1 \
--max-model-len 131072 \
--media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
--video-pruning-rate 0.5 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser nemotron_v3