NVIDIA DGX Spark 使用 Ollama 的效能表現
Ollama 已發佈 NVIDIA DGX Spark 的效能基準測試,展示了該硬體使用 Ollama v0.12.6 執行各種大型語言模型 (LLMs) 的能力。這些測試證明了 GB10 Grace Blackwell Superchip 的吞吐量能力,特別是其在 120GB VRAM 的容量下處理如 gpt-oss-120b 等大型模型的能力。
效能基準測試
Ollama 在 NVIDIA DGX Spark 上的測試顯示,在不同的模型架構與量化層級下,具有不同的 prefill 與 decode 速度。這些基準測試是使用韌體版本 580.95.05 進行的,測試時溫度設定為 0,並停用了快取,且輸出限制在 500 個 tokens。
吞吐量結果
| Device | Model name | Model size | Quantization | Prefill (tokens/sec) | Decode (tokens/sec) |
|---|---|---|---|---|---|
| NVIDIA DGX Spark | gpt-oss | 20B | MXFP4 | 3.224k | 58.27 |
| NVIDIA DGX Spark | gpt-oss | 120B | MXFP4 | 1.169k | 41.14 |
| NVIDIA DGX Spark | gemma3 | 12B | q4_K_M | 1.894k | 24.25 |
| NVIDIA DGX Spark | gemma3 | 12B | q8_0 | 1.406k | 15.46 |
| NVIDIA DGX Spark | gemma3 | 27B | q4_K_M | 834.1 | 10.83 |
| NVIDIA DGX Spark | gemma3 | 27B | q8_0 | 585.4 | 7.210 |
| NVIDIA DGX Spark | llama3.1 | 8B | q4_K_M | 7.614k | 38.02 |
| NVIDIA DGX Spark | llama3.1 | 8B | q8_0 | 6.110k | 25.23 |
| NVIDIA DGX Spark | llama3.1 | 70B | q4_K_M | 1.911k | 4.423 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q4_K_M | 5.919k | 19.99 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q8_0 | 4.667k | 1.433 |
| NVIDIA DGX Spark | qwen3 | 32B | q4_K_M | 705.0 | 9.411 |
| NVIDIA DGX Spark | qwen3 | 32B | q8_0 | 487.2 | 6.240 |
技術測試參數
為了確保一致性,每項測試均執行了 10 次,使用一個要求對《雙城記》(A Tale of Two Cities) 前 200 行內容進行深入摘要的提示詞 (prompt)。測試腳本及其相關的 readme 均可供公開自定義。
關於 gpt-oss 模型,Ollama 使用的是 OpenAI 提供的官方版本。雖然網路上發現的部分標記為 MXFP4 的 GGUF 檔案在 attention layers 中被進一步量化為 q8_0,但 Ollama 將這些層級維持在 OpenAI 預期的 BF16。
硬體與軟體需求
在 NVIDIA DGX Spark 上獲得最佳效能需要特定的韌體與軟體版本。如果韌體版本低於 580.95.05,Ollama 建議使用 DGX Dashboard 進行更新。
對於偏好命令列介面 (CLI) 的使用者,更新程序需要使用以下順序同時升級 Ubuntu 發行版與韌體:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot
與 OpenAI Codex 的整合
Ollama 與 OpenAI 的 Codex 運作無縫整合。使用者可以透過 npm 安裝 Codex CLI (npm install -g @openai/codex) 並使用指令 codex --oss --model gpt-oss 來執行模型。
由於 NVIDIA DGX Spark 由 GB10 Grace Blackwell Superchip 提供動力,它提供 120GB 的 VRAM,使得較大的 gpt-oss-120b 模型能完全放入 GPU 記憶體中:
codex --oss --model gpt-oss:120b
Sources
- OriginalNVIDIA DGX Spark performance
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch