Ollamaを使用したNVIDIA DGX Sparkのパフォーマンス

Ollamaは、NVIDIA DGX Sparkのパフォーマンスベンチマークを公開しました。これにより、Ollama v0.12.6を使用して幅広い大規模言語モデル(LLM)を実行するハードウェアの能力が示されています。これらのテストは、GB10 Grace Blackwell Superchipの、特に120GBのVRAM内でgpt-oss-120bのような大規模なモデルを処理する能力におけるスループット性能を実証しています。

Performance Benchmarks

NVIDIA DGX SparkにおけるOllamaのテストでは、異なるモデルアーキテクチャや量子化レベルによって、prefill(プリフィル)およびdecode(デコード)速度が変化することが示されています。ベンチマークは、ファームウェアバージョン580.95.05を使用し、温度を0に設定、キャッシュを無効化、出力を500トークンに制限して実施されました。

Throughput Results

Device Model name Model size Quantization Prefill (tokens/sec) Decode (tokens/sec)
NVIDIA DGX Spark gpt-oss 20B MXFP4 3.224k 58.27
NVIDIA DGX Spark gpt-oss 120B MXFP4 1.169k 41.14
NVIDIA DGX Spark gemma3 12B q4_K_M 1.894k 24.25
NVIDIA DGX Spark gemma3 12B q8_0 1.406k 15.46
NVIDIA DGX Spark gemma3 27B q4_K_M 834.1 10.83
NVIDIA DGX Spark gemma3 27B q8_0 585.4 7.210
NVIDIA DGX Spark llama3.1 8B q4_K_M 7.614k 38.02
NVIDIA DGX Spark llama3.1 8B q8_0 6.110k 25.23
NVIDIA DGX Spark llama3.1 70B q4_K_M 1.911k 4.423
NVIDIA DGX Spark deepseek-r1 14B q4_K_M 5.919k 19.99
NVIDIA DGX Spark deepseek-r1 14B q8_0 4.667k 1.433
NVIDIA DGX Spark qwen3 32B q4_K_M 705.0 9.411
NVIDIA DGX Spark qwen3 32B q8_0 487.2 6.240

Technical Testing Parameters

一貫性を確保するため、各テストは「A Tale of Two Cities」の最初の200行の深い要約を求めるプロンプトを使用して10回実施されました。テストスクリプトと関連するreadmeは、公開されておりカスタマイズ可能です。

Regarding the gpt-oss models, OllamaはOpenAIが提供する公式バージョンを使用しています。オンラインで見つかるMXFP4とラベル付けされた一部のGGUFは、attention層においてq8_0にさらに量子化されていますが、OllamaはOpenAIの意図通り、これらの層をBF16として維持しています。

Hardware and Software Requirements

NVIDIA DGX Sparkで最適なパフォーマンスを得るには、特定のファームウェアおよびソフトウェアバージョンが必要です。ファームウェアがバージョン580.95.05未満の場合は、アップデートのためにDGX Dashboardの使用を推奨します。

コマンドラインインターフェース(CLI)を好むユーザーの場合、アップデートプロセスには、以下の手順でUbuntuディストリビューションとファームウェアの両方をアップグレードする必要があります。

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot

Integration with OpenAI Codex

OllamaはOpenAIのCodexとシームレスに連携します。ユーザーはnpm経由でCodex CLIをインストール(npm install -g @openai/codex)し、codex --oss --model gpt-ossコマンドを使用してモデルを実行できます。

NVIDIA DGX SparkはGB10 Grace Blackwell Superchipを搭載しているため、120GBのVRAMを提供し、より大規模なgpt-oss-120bモデルをGPUメモリ内に完全に収めることができます。

codex --oss --model gpt-oss:120b

Sources

関連