vLLM 中對 NVIDIA Nemotron 3 Nano Omni 的支援

vLLM 現已支援 NVIDIA Nemotron 3 Nano Omni,這是一個開源的多模態模型,旨在透過將視覺、音訊與語言推理統合於單一高效迴圈來驅動代理式 AI。此整合讓開發者能部署取代傳統碎片化多模態堆疊的模型——通常需要將視覺、語音與語言的獨立模型拼接在一起——從而減少推論跳躍、協調開銷與上下文碎片化。

統一多模態架構

Nemotron 3 Nano Omni 將分散的感知模型合併為單一推理迴圈,能同時處理文字、影像、影片與音訊輸入。此架構專為企業代理工作流程設計,需持續感知螢幕、文件與視聽串流。

技術規格

  • 架構: 混合專家 (MoE) 與混合 Transformer‑Mamba 架構。
  • 模型大小: 總參數 30B,單次前向僅啟用 3B 參數。
  • 上下文長度: 256K 令牌。
  • 時間處理: 使用 3D 捲積層 (Conv3D) 高效處理影片的時空資料。
  • 模態: 支援文字、影像、影片與音訊作為輸入,文字為輸出。

效能與效率提升

Nemotron 3 Nano Omni 相較於其他開源 omni 模型與先前版本,提供顯著更高的吞吐量與更低的運算成本。

吞吐量與可擴展性

模型在相同互動層級下,達到其他開源 omni 模型的 9 倍吞吐量。具體在固定每位使用者互動門檻下,模型表現為:

  • 影片使用情境: 9.2 倍更高的吞吐量。
  • 多文件使用情境: 7.4 倍更高的吞吐量。

計算效率

為在不產生成本負擔的前提下維持高效能,模型採用了多項最佳化技術:

  • 高效影片抽樣 (EVS): 透過時間感知感知,在相同運算預算下處理更長影片。
  • 量化支援: 支援 BF16、FP8 與 NVFP4 精度,加速推論並提升同一 GPU 上的請求容量。
  • 硬體相容性: 為 NVIDIA B200、H100、H200、A100、L40S、DGX Spark 與 RTX 6000 GPU 進行最佳化。

多模態智慧與準確性

Nemotron 3 Nano Omni 在多模態推理準確度上較前代 Nemotron Nano VL V2 有顯著提升,於六大產業排行榜中取得領先位置。

基準測試成功

模型在多個專業領域中領先:

  • 文件智慧: 在 MMlongbench‑Doc 與 OCRBenchV2 上取得最佳表現。
  • 影片與音訊理解: 在 WorldSense、DailyOmni 與 VoiceBench 上取得領先成果。
  • MediaPerf: 在所有任務中達到最高吞吐量,且在影片層級標記上擁有最低推論成本。

訓練方法論

準確度提升源自於使用 NVIDIA NeMo RL 與 NeMo Gym 於文字、影像、音訊與影片環境進行的多環境強化學習,增進指令遵循與多模態答案的收斂。

使用 vLLM 部署

Nemotron 3 Nano Omni 可透過 vLLM 以相容 OpenAI 的 API 服務。部署需要 vllm[audio]==0.20.0,並支援影片剪枝與自動工具選擇等進階設定。

範例伺服器指令

python3 -m vllm.entrypoints.openai.api_server \
    --model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
    --served-model-name nemotron \
    --trust-remote-code \
    --dtype auto \
    --host 0.0.0.0 \
    --port 5000 \
    --tensor-parallel-size 1 \
    --max-model-len 131072 \
    --media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
    --video-pruning-rate 0.5 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

Sources