vLLM에서의 NVIDIA Nemotron 3 Ultra 지원

vLLM에서의 NVIDIA Nemotron 3 Ultra 지원

vLLM은 장기 실행되는 자율 에이전트 워크플로우를 위해 특별히 설계된 프런티어급 추론 모델인 NVIDIA Nemotron 3 Ultra에 대한 Day-0 지원을 발표했습니다. 이번 통합을 통해 개발자는 OpenAI 호환 API를 사용하여 복잡한 오케스트레이션, 코딩 및 심층 연구가 가능한 고처리량 에이전트 AI 시스템을 배포할 수 있습니다.

Nemotron 3 Ultra 기술 사양

Nemotron 3 Ultra는 지속적인 에이전트 시스템에서의 실질적인 배포를 위해 추론 속도를 보장하면서 추론 깊이를 유지하도록 설계된 오픈 웨이트(open-weights) 모델입니다.

  • Architecture: Hybrid Transformer-Mamba 아키텍처를 활용하는 Mixture of Experts (MoE).
  • Parameter Count: 총 550B 파라미터, 활성 파라미터 55B.
  • Context Window: 최대 1M 토큰 지원.
  • Modalities: 텍스트 입력 및 텍스트 출력.
  • Precision Support: NVFP4 및 BF16를 통한 고처리량 추론.
  • Hardware Compatibility:
    • BF16: 8x GB200/B200/GB300/B300, 16x H100 또는 8x H200 GPU에서 지원.
    • NVFP4: 4x GB200/B200/GB300/B300 또는 8x H100 GPU에서 지원 (NVFP4 체크포인트는 특히 Blackwell GPU에서 작동함).

에이전트 추론을 위한 아키텍처 혁신

고용량 추론에서 효율성과 정확성의 균형을 맞추기 위해 Nemotron 3 Ultra는 여러 아키텍처적 발전을 구현했습니다:

Hybrid Mamba-Transformer Layers

긴 컨텍스트 워크로드에서 시퀀스 효율성을 위한 Mamba 레이어와 대규모 컨텍스트 윈도우에서 특정 사실에 대한 정밀한 회상을 보장하기 위한 Transformer 레이어를 결합했습니다.

Latent MoE 및 Multi-Token Prediction (MTP)

Latent MoE는 코드 생성 및 도구 호출과 같은 다양한 작업에 대해 더 효율적인 전문가 라우팅을 가능하게 합니다. Multi-Token Prediction (MTP)은 단일 포워드 패스에서 여러 미래 토큰을 예측함으로써 생성 시간을 단축하고 멀티 턴 워크플로우의 처리량을 높입니다.

에이전트 특화 사후 학습 (Agent-Specific Post-Training)

이 모델은 다양한 에이전트 하네스를 통해 NVIDIA NeMo RL 및 Gym을 사용하여 사후 학습되었습니다. 이 최적화는 단순한 단일 턴 채팅이 아니라, 에이전트가 계획을 세우고, 도구를 호출하고, 관찰 내용을 읽고, 하위 에이전트에게 위임하고, 오류로부터 복구해야 하는 멀티 턴 워크플로우에 집중합니다.

성능 및 비용 효율성

Nemotron 3 Ultra는 에이전트 생산성, 지시 이행 및 긴 컨텍스트 작업 분야에서 오픈 모델 중 선두주자로 자리매김하고 있습니다. 소스 자료에 따르면, 이 모델은 선도적인 다른 오픈 모델들과 비교했을 때 최고 수준의 처리량을 제공하며 비용을 최대 30%까지 절감합니다.

vLLM을 통한 배포

vLLM은 Nemotron 3 Ultra 학습 워크플로우의 핵심 구성 요소로 작용하여, 롤아웃 및 모델 평가를 위한 고처리량 멀티 노드 추론을 제공했습니다. 현재 NeMo RL 내의 강화 학습 롤아웃을 위한 생성 백엔드로 기능하며, 멀티 스텝 학습 환경을 위해 NeMo Gym과 통합되어 있습니다.

모델 서빙

개발자는 OpenAI 호환 API를 사용하여 vLLM을 통해 Nemotron 3 Ultra를 서빙할 수 있습니다. 8x B200 설정에 대한 일반적인 구성에는 다음 플래그가 포함됩니다:

  • --tensor-parallel-size 8
  • --kv-cache-dtype fp8
  • --speculative_config.method mtp (Multi-Token Prediction 활용)
  • --reasoning-parser nemotron_v3
  • --tool-call-parser qwen3_coder

모델 가중치는 Hugging Face에서 BF16 및 NVFP4 형식으로 사용할 수 있습니다.

Sources