NVIDIA Nemotron 3 Ultra Support on vLLM

NVIDIA Nemotron 3 Ultra Support on vLLM

vLLM は、長時間実行される自律エージェント ワークフローのために特別に設計されたフロンティアクラスの推論モデルである NVIDIA Nemotron 3 Ultra の Day-0 サポートを発表しました。この統合により、開発者は OpenAI 互換 API を使用して、複雑なオーケストレーション、コーディング、およびディープリサーチを実行できる高スループットのエージェント AI システムをデプロイできるようになります。

Nemotron 3 Ultra 技術仕様

Nemotron 3 Ultra は、永続的なエージェント システムへの実際のデプロイにおいて推論速度を確保しながら推論の深さを維持するように設計されたオープンウェイトモデルです。

  • Architecture: エキスパートの混合 (MoE) を利用する Hybrid Transformer-Mamba アーキテクチャ
  • Parameter Count: 合計 550B パラメータ、うちアクティブなパラメータは 55B
  • Context Window: 最大 1M トークンをサポート
  • Modalities: テキスト入力およびテキスト出力
  • Precision Support: NVFP4 と BF16 を介した高スループット推論
  • Hardware Compatibility:
    • BF16: Supported on 8x GB200/B200/GB300/B300, 16x H100, or 8x H200 GPUs.
    • NVFP4: Supported on 4x GB200/B200/GB300/B300 or 8x H100 GPUs (NVFP4 checkpoints specifically work on Blackwell GPUs).

エージェント推論のためのアーキテクチャの革新

高容量推論における効率と精度のバランスを取るため、Nemotron 3 Ultra はいくつかのアーキテクチャの進歩を実装しています:

ハイブリッド Mamba-Transformer レイヤー

長コンテキスト ワークロードにおけるシーケンス効率のための Mamba レイヤーと、大規模なコンテキスト ウィンドウから特定の事実を正確に想起するための Transformer レイヤーを組み合わせます。

ラテン MoE とマルチトークン予測 (MTP)

ラテン MoE は、コード生成やツール呼び出しなどの多様なタスクにおけるエキスパート ルーティングをより効率的にします。マルチトークン予測 (MTP) は、シングルフォワードパスで複数の未来トークンを予測することにより生成時間を短縮し、マルチターン ワークフローのスループットを向上させます。

エージェント固有のポストトレーニング

このモデルは、さまざまなエージェント ハーネスにおいて NVIDIA NeMo RL と Gym を使用してポストトレーニングされています。この最適化は、エージェントが計画を立て、ツールを呼び出し、観測値を読み取り、サブエージェントに委任し、エラーから回復する必要があるマルチターン ワークフローに焦点を当てており、単純なシングルターン チャットとは異なります。

パフォーマンスとコスト効率

Nemotron 3 Ultra は、エージェントの生産性、指示従順、長コンテキスト タスクにおけるオープンモデルのリーダーとして位置付けられています。ソース資料によると、このモデルは最高のスループットを提供し、他の主要なオープンモデルと比較してコストを最大 30% 削減します。

vLLM を使用したデプロイ

vLLM は、Nemotron 3 Ultra のトレーニング ワークフローにおける重要なコンポーネントとして機能し、ロールアウトとモデル評価のための高スループットマルチノード推論を提供しています。現在、NeMo RL 内の強化学習ロールアウトの生成バックエンドとして機能し、マルチステップ トレーニング環境のために NeMo Gym と統合されています。

モデルの提供

開発者は、OpenAI 互換 API を使用して vLLM を通じて Nemotron 3 Ultra を提供できます。8x B200 セットアップの典型的な構成には、次のフラグが含まれます:

  • --tensor-parallel-size 8
  • --kv-cache-dtype fp8
  • --speculative_config.method mtp (Multi-Token Prediction を利用)
  • --reasoning-parser nemotron_v3
  • --tool-call-parser qwen3_coder

モデルの重みは、BF16 と NVFP4 の両方の形式で Hugging Face から入手できます。

Sources