vLLMにおけるNVIDIA Nemotron 3.5 LightningのDay-0サポート

TL;DR

NVIDIAは、vLLMサービングエンジンにおける30BパラメータのNemotron 3.5 LightningモデルのDay-0サポートを発表しました。ハイブリッドMoE(Mixture-of-Experts)設計と3つの投機的デコーディング手法(Multi-Token Prediction, DFlash, DSpark)により、常時稼働型エージェントののスループットを最大4倍向上させます。


なぜNemotron 3.5 Lightningがエージェントワークロードに重要なのか

Nemotron 3.5 Lightningは、現代のエージェントパイプラインにおける「セカンドティア」の役割をターゲットにしています。これは、大規模なフロンティアモデルが高レベルのプランニングを行う一方で、頻繁に発生する限定的なステップを処理する軽量モデルです。そのハイブリッドMoEアーキテクチャは、トークンあたり全30Bパラメータのうち3Bのみをアクティブ化するため、トークンあたりの計算量を削減し、1Mトークンのコンテキストウィンドウを可能にします。マルチトークン予測と組み合わせることで、同規模のオープンモデルと比較して最大4倍の高いスループットを実現し、データセンター、クラウド、またはエッジ環境における大量の常時稼働型エージェントにとって経済的に実行可能なものにします。


コア技術仕様

機能 詳細
アーキテクチャ ハイブリッドMixture-of-Experts (MoE)。総パラメータ数30B、トークンあたり3Bをアクティブ化
コンテキスト長 最大100万トークン
モダリティ テキスト入力 → テキスト出力
投機的デコーディング Multi-Token Prediction (MTP), DFlash, DSpark
推論制御 リクエストごとに有効/無効の切り替えが可能。推論トークン予算の設定が可能
学習系統 NVIDIA Nemotron 3 Ultraから蒸留。人気の高いエージェント用ハーネスで微調整済み
カスタマイズ性 オープンモデル。ドメイン特化データによるポストトレーニングをサポート
リリース時の精度フォーマット BF16 および NVFP4
サポートハードウェア NVIDIA DGX Spark, DGX Station, RTX PRO/RTX, Jetson, H100, H200, A100, L40S, B200/GB200, B300/GB300

vLLMでの始め方

vLLMコンテナのインストール

docker pull vllm/vllm-openai:v0.27.1

docker run --rm -it \
  --gpus all \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  vllm/vllm-openai:v0.27.1

Nemotron 3.5 Lightningのサービング(例: 1× H100)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --enable-prefix-caching \
  --async-scheduling \
  --mamba-backend flashinfer \
  --moe-backend humming \
  --linear-backend humming \
  --mamba-ssu-algorithm horizontal \
  --mamba-cache-mode align \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --reasoning-parser nemotron_v3 \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice \
  --host 0.0.0.0 \
  --port 8000

OpenAI互換クライアントのサンプル呼び出し

from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="null")

resp = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is vLLM?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)

choice = resp.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)

投機的デコーディング技術

Multi-Token Prediction (MTP)

MTPは、将来のトークンの小さなブロックを提案する軽量な予測ヘッドを追加します。ターゲットモデルがそのブロックを検証することで、逐次ステップの数を削減します。

vllm serve... \
  --speculative_config.method mtp \
  --speculative_config.num_speculative_tokens 3

DFlash

DFlashは、専用の拡散ドラフトモデルを使用して、候補ブロック全体を並列に生成します。これには個別のドラフト・チェックポイントが必要です。

vllm serve... \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
  --speculative_config.num_speculative_tokens 3

ドラフト・チェックポイント: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash

DSpark

DSparkは、自己回帰型と拡散型ドラフトをブレンドし、MTPとDFlashの中間的なアプローチを提供します。DGX Sparkにおいて最高のレイテンシとスループットのトレードオフを実現します。

vllm serve... \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
  --speculative_config.num_speculative_tokens 3

ドラフト・チェックポイント: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark


vLLMへのアップストリーム・パフォーマンス貢献

  • Nemotronモデルの定義にDSpark speculatorを統合。
  • DSparkドラフトヘッドをW4A16に量子化し、メモリ使用量とレイテンシを削減。
  • ドラフト・アンド・ベリファイ・ループ内のホスト・デバイス同期を削除し、非同期スケジューリングを有効化。
  • MoEおよびデンス層において、デフォルトのMarlinバックエンドをHopper最適化されたHummingバックエンドに置き換え、約20%のスループット向上を実現。
  • Mamba2状態空間層へのReplaySSMサポートを追加し、再帰パスのオーバーヘッドを削減。

ハードウェア別デプロイガイド

DGX Spark (シングルユーザー)

vllm serve... \
  --max-num-batched-tokens 16384 \
  --compilation_config.cudagraph_capture_sizes '[1,2,4,8,16,24,32,40,48,56,64,72,80,88,96,104,112,120,128,136,144,152,160,168,176,184,192,200,208,216,224,232,240,248,256,1024,2048,4096,8192]' \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

Pareto chart of inference performance on DGX Spark

NVIDIA H100 (シングルユーザー)

vllm serve... \
  --moe-backend humming \
  --linear-backend humming \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --async-scheduling

Pareto chart of inference performance on H100 GPUs

NVIDIA Jetson (エッジ)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --reasoning-parser nemotron_v3 \
  --kv-cache-dtype fp8 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align

精度と効率のフロンティア

Nemotron 3.5 LightningはNemotron 3 Ultraの能力を継承しており、エージェント中心のデータセットで微調整されています。ベンチマーク(PinchBench)では、Qwen 3.6 35Bのような大規模モデルに匹敵する精度を達成しつつ、10,000のタスクを最大30%速く完了することを示しています。 Efficiency frontier line chart


モデルの入手方法


Nemotron 3 Nanoとの比較

Nemotron 3 NanoはハイブリッドMamba-Transformer MoE設計を導入しました。Nemotron 3.5 Lightningは、以下の点によってこれを拡張しています:

  1. Nemotron 3 Ultraからフロンティアモデルの能力を蒸留。
  2. エージェント用ハーネスとマルチターン・ワークフローに最適化された学習。
  3. 生成を加速させるための3つの投機的デコーディング・パス(MTP, DFlash, DSpark)の追加。 その結果、エージェントタスクにおける精度の向上と、最大4倍のスループット改善を実現しています。

謝辞

NVIDIA 貢献者: Nirmal Kumar Juluru, Anusha Pant, Amir Klein, Faradawn Yang, Nave Assaf, Ryan Stewart, Alex Steiner, Bita Rouhani.

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch