vLLM에서 NVIDIA Nemotron 3 Nano Omni 지원

vLLM은 이제 비전, 오디오, 언어 추론을 하나의 효율적인 루프로 통합하여 에이전트 AI를 구동하도록 설계된 오픈 멀티모달 모델인 NVIDIA Nemotron 3 Nano Omni를 지원합니다. 이 통합을 통해 개발자는 일반적으로 비전, 음성, 언어용 별도 모델을 결합해 사용하던 파편화된 멀티모달 스택을 대체하는 모델을 배포할 수 있어 추론 단계 수, 오케스트레이션 오버헤드 및 컨텍스트 파편화를 줄일 수 있습니다.

통합 멀티모달 아키텍처

Nemotron 3 Nano Omni는 별도의 인식 모델들을 하나의 추론 루프로 통합하여 텍스트, 이미지, 비디오, 오디오 입력을 동시에 처리할 수 있습니다. 이 아키텍처는 화면, 문서, 시청각 스트림을 지속적으로 인식해야 하는 기업용 에이전트 워크플로를 위해 특별히 설계되었습니다.

기술 사양

  • Architecture: 전문가 혼합(MoE)과 하이브리드 Transformer‑Mamba 아키텍처.
  • Model Size: 총 30B 파라미터이며, 전방 패스당 활성 파라미터는 3B만 사용됩니다.
  • Context Length: 256K 토큰.
  • Temporal Processing: 비디오의 시공간 데이터를 효율적으로 처리하기 위해 3D 컨볼루션 레이어(Conv3D)를 사용합니다.
  • Modalities: 입력으로 텍스트, 이미지, 비디오, 오디오를 지원하며, 출력은 텍스트입니다.

성능 및 효율성 향상

Nemotron 3 Nano Omni는 다른 오픈 옴니 모델 및 이전 버전에 비해 훨씬 높은 처리량과 낮은 연산 비용을 제공합니다.

처리량 및 확장성

이 모델은 동일한 수준의 인터랙티브성을 가진 다른 오픈 옴니 모델에 비해 9배 높은 처리량을 달성합니다. 특히, 사용자당 고정된 인터랙티브성 임계값에서 측정했을 때 다음과 같은 결과를 보입니다:

  • Video Use Cases: 9.2배 높은 처리량.
  • Multi-Document Use Cases: 7.4배 높은 처리량.

연산 효율성

높은 성능을 유지하면서도 비용 부담을 줄이기 위해 모델은 여러 최적화 기법을 사용합니다:

  • Efficient Video Sampling (EVS): 시간 인식 인식을 통해 동일한 연산 예산 내에서 더 긴 비디오를 처리할 수 있게 합니다.
  • Quantization Support: BF16, FP8, NVFP4 정밀도를 지원하여 추론을 가속화하고 동일 GPU에서 요청 처리량을 늘립니다.
  • Hardware Compatibility: NVIDIA B200, H100, H200, A100, L40S, DGX Spark, RTX 6000 GPU에 최적화되었습니다.

멀티모달 인텔리전스 및 정확도

Nemotron 3 Nano Omni는 이전 Nemotron Nano VL V2 모델에 비해 멀티모달 추론 정확도가 크게 향상되어 여섯 개 산업 리더보드에서 상위 순위를 차지했습니다.

벤치마크 성공

이 모델은 여러 특화된 분야에서 선두를 차지합니다:

  • Document Intelligence: MMlongbench-Doc 및 OCRBenchV2에서 최고 성능을 기록했습니다.
  • Video and Audio Understanding: WorldSense, DailyOmni, VoiceBench에서 선도적인 결과를 보였습니다.
  • ### MediaPerf: 모든 작업에서 가장 높은 처리량과 비디오 수준 태깅에 대한 가장 낮은 추론 비용을 달성했습니다.

학습 방법론

정확도 향상은 텍스트, 이미지, 오디오, 비디오 환경 전반에 걸쳐 NVIDIA NeMo RL 및 NeMo Gym을 활용한 다중 환경 강화 학습에 의해 이루어졌으며, 이는 지시 수행 능력과 멀티모달 답변의 수렴을 개선했습니다.

vLLM을 통한 배포

Nemotron 3 Nano Omni는 vLLM을 사용한 OpenAI 호환 API를 통해 제공될 수 있습니다. 배포에는 vllm[audio]==0.20.0이 필요하며, 비디오 프루닝 및 자동 도구 선택과 같은 고급 설정을 지원합니다.

예시 서버 명령

python3 -m vllm.entrypoints.openai.api_server \
    --model "nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16" \
    --served-model-name nemotron \
    --trust-remote-code \
    --dtype auto \
    --host 0.0.0.0 \
    --port 5000 \
    --tensor-parallel-size 1 \
    --max-model-len 131072 \
    --media-io-kwargs '{"video":{"num_frames":512,"fps":1}}' \
    --video-pruning-rate 0.5 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

Sources