vLLM에서 NVIDIA Nemotron 3 Super 지원
vLLM은 이제 복잡한 멀티 에이전트 AI 애플리케이션을 위해 특별히 설계된 오픈 하이브리드 Mixture-of-Experts(MoE) 모델인 NVIDIA Nemotron 3 Super를 지원합니다. 이 통합을 통해 개발자는 대규모 에이전트 시스템에 필요한 높은 지능과 계산 효율성을 균형 있게 제공하는 모델을 배포할 수 있습니다.
멀티 에이전트 AI를 위한 고효율 아키텍처
Nemotron 3 Super는 하이브리드 Transformer‑Mamba 아키텍처와 Mixture-of-Experts(MoE) 설계를 활용하여 에이전트 워크플로와 관련된 "생각 비용" 및 컨텍스트 오버헤드를 최소화합니다.
주요 기술 사양
- Model Parameters: 총 1,200억 파라미터 중 추론 시 활성 파라미터는 120억만 사용됩니다.
- Context Window: 최대 100만 토큰을 지원하여 목표 드리프트를 감소시키고 멀티 에이전트 시스템에서 반복된 히스토리와 도구 출력으로 인한 "컨텍스트 폭발" 문제를 해결합니다.
- Throughput: 기존 대형 모델 대비 최대 4배, 이전 Nemotron Super 모델 대비 최대 5배 높은 처리량을 제공합니다.
- Multi-Token Prediction (MTP): 단일 포워드 패스에서 여러 미래 토큰을 동시에 예측함으로써 장문 텍스트 생성을 가속화합니다.
- Latent MoE: 하나의 전문가 비용으로 네 명의 전문가를 활성화할 수 있게 합니다.
- Thinking Budget: 추론 토큰 생성량을 제어하여 최적의 정확도를 달성합니다.
성능 및 개방성
Nemotron 3 Super는 Artificial Analysis Intelligence 및 Openness 지표에서 선도적인 오픈 모델로 자리매김하고 있습니다. 완전한 오픈 모델로서 오픈 가중치, 데이터셋, 레시피를 제공하여 맞춤화와 사설 인프라에 안전하게 배포할 수 있도록 합니다.
Artificial Analysis 벤치마크에 따르면, 이 모델은 동일 크기 범주에서 선도적인 정확도를 달성했으며—이전 Nemotron Super 모델 대비 최대 2배 높은 정확도—동시에 유사한 크기의 다른 오픈 모델에 비해 높은 효율성을 유지합니다.
vLLM을 통한 배포
vLLM은 BF16, FP8, NVFP4 등 다양한 정밀도 포맷에서 Nemotron 3 Super에 대한 최적화된 추론을 지원합니다. Blackwell GPU에서는 NVFP4가 H100의 FP8 대비 4배 높은 처리량을 제공하면서 정확성을 유지합니다.
하드웨어 지원
지원되는 GPU는 다음과 같습니다:
- NVIDIA B200
- NVIDIA H100
- DGX Spark
- RTX 6000
빠른 시작 구현
모델을 vLLM(버전 0.17.1)으로 서비스하려면, 4x H100 설정을 OpenAI 호환 API를 통해 다음 명령으로 구성할 수 있습니다:
# BF16
vllm serve nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
--kv-cache-dtype fp8 \
--tensor-parallel-size 4 \
--trust-remote-code \
--served-model-name nemotron \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser nemotron_v3
서버가 활성화되면, OpenAI Python 클라이언트를 사용하여 모델에 프롬프트를 보낼 수 있으며, 응답에서 reasoning_content와 최종 content 모두에 접근할 수 있습니다.