Ollamaを使用したNVIDIA DGX Sparkのパフォーマンス
Ollamaは、NVIDIA DGX Sparkのパフォーマンスベンチマークを公開しました。これにより、Ollama v0.12.6を使用して幅広い大規模言語モデル(LLM)を実行するハードウェアの能力が示されています。これらのテストは、GB10 Grace Blackwell Superchipの、特に120GBのVRAM内でgpt-oss-120bのような大規模なモデルを処理する能力におけるスループット性能を実証しています。
Performance Benchmarks
NVIDIA DGX SparkにおけるOllamaのテストでは、異なるモデルアーキテクチャや量子化レベルによって、prefill(プリフィル)およびdecode(デコード)速度が変化することが示されています。ベンチマークは、ファームウェアバージョン580.95.05を使用し、温度を0に設定、キャッシュを無効化、出力を500トークンに制限して実施されました。
Throughput Results
| Device | Model name | Model size | Quantization | Prefill (tokens/sec) | Decode (tokens/sec) |
|---|---|---|---|---|---|
| NVIDIA DGX Spark | gpt-oss | 20B | MXFP4 | 3.224k | 58.27 |
| NVIDIA DGX Spark | gpt-oss | 120B | MXFP4 | 1.169k | 41.14 |
| NVIDIA DGX Spark | gemma3 | 12B | q4_K_M | 1.894k | 24.25 |
| NVIDIA DGX Spark | gemma3 | 12B | q8_0 | 1.406k | 15.46 |
| NVIDIA DGX Spark | gemma3 | 27B | q4_K_M | 834.1 | 10.83 |
| NVIDIA DGX Spark | gemma3 | 27B | q8_0 | 585.4 | 7.210 |
| NVIDIA DGX Spark | llama3.1 | 8B | q4_K_M | 7.614k | 38.02 |
| NVIDIA DGX Spark | llama3.1 | 8B | q8_0 | 6.110k | 25.23 |
| NVIDIA DGX Spark | llama3.1 | 70B | q4_K_M | 1.911k | 4.423 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q4_K_M | 5.919k | 19.99 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q8_0 | 4.667k | 1.433 |
| NVIDIA DGX Spark | qwen3 | 32B | q4_K_M | 705.0 | 9.411 |
| NVIDIA DGX Spark | qwen3 | 32B | q8_0 | 487.2 | 6.240 |
Technical Testing Parameters
一貫性を確保するため、各テストは「A Tale of Two Cities」の最初の200行の深い要約を求めるプロンプトを使用して10回実施されました。テストスクリプトと関連するreadmeは、公開されておりカスタマイズ可能です。
Regarding the gpt-oss models, OllamaはOpenAIが提供する公式バージョンを使用しています。オンラインで見つかるMXFP4とラベル付けされた一部のGGUFは、attention層においてq8_0にさらに量子化されていますが、OllamaはOpenAIの意図通り、これらの層をBF16として維持しています。
Hardware and Software Requirements
NVIDIA DGX Sparkで最適なパフォーマンスを得るには、特定のファームウェアおよびソフトウェアバージョンが必要です。ファームウェアがバージョン580.95.05未満の場合は、アップデートのためにDGX Dashboardの使用を推奨します。
コマンドラインインターフェース(CLI)を好むユーザーの場合、アップデートプロセスには、以下の手順でUbuntuディストリビューションとファームウェアの両方をアップグレードする必要があります。
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot
Integration with OpenAI Codex
OllamaはOpenAIのCodexとシームレスに連携します。ユーザーはnpm経由でCodex CLIをインストール(npm install -g @openai/codex)し、codex --oss --model gpt-ossコマンドを使用してモデルを実行できます。
NVIDIA DGX SparkはGB10 Grace Blackwell Superchipを搭載しているため、120GBのVRAMを提供し、より大規模なgpt-oss-120bモデルをGPUメモリ内に完全に収めることができます。
codex --oss --model gpt-oss:120b
Sources
- OriginalNVIDIA DGX Spark performance
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch