NVIDIA DGX Spark 使用 Ollama 的效能表現

Ollama 已發佈 NVIDIA DGX Spark 的效能基準測試,展示了該硬體使用 Ollama v0.12.6 執行各種大型語言模型 (LLMs) 的能力。這些測試證明了 GB10 Grace Blackwell Superchip 的吞吐量能力,特別是其在 120GB VRAM 的容量下處理如 gpt-oss-120b 等大型模型的能力。

效能基準測試

Ollama 在 NVIDIA DGX Spark 上的測試顯示,在不同的模型架構與量化層級下,具有不同的 prefill 與 decode 速度。這些基準測試是使用韌體版本 580.95.05 進行的,測試時溫度設定為 0,並停用了快取,且輸出限制在 500 個 tokens。

吞吐量結果

Device Model name Model size Quantization Prefill (tokens/sec) Decode (tokens/sec)
NVIDIA DGX Spark gpt-oss 20B MXFP4 3.224k 58.27
NVIDIA DGX Spark gpt-oss 120B MXFP4 1.169k 41.14
NVIDIA DGX Spark gemma3 12B q4_K_M 1.894k 24.25
NVIDIA DGX Spark gemma3 12B q8_0 1.406k 15.46
NVIDIA DGX Spark gemma3 27B q4_K_M 834.1 10.83
NVIDIA DGX Spark gemma3 27B q8_0 585.4 7.210
NVIDIA DGX Spark llama3.1 8B q4_K_M 7.614k 38.02
NVIDIA DGX Spark llama3.1 8B q8_0 6.110k 25.23
NVIDIA DGX Spark llama3.1 70B q4_K_M 1.911k 4.423
NVIDIA DGX Spark deepseek-r1 14B q4_K_M 5.919k 19.99
NVIDIA DGX Spark deepseek-r1 14B q8_0 4.667k 1.433
NVIDIA DGX Spark qwen3 32B q4_K_M 705.0 9.411
NVIDIA DGX Spark qwen3 32B q8_0 487.2 6.240

技術測試參數

為了確保一致性,每項測試均執行了 10 次,使用一個要求對《雙城記》(A Tale of Two Cities) 前 200 行內容進行深入摘要的提示詞 (prompt)。測試腳本及其相關的 readme 均可供公開自定義。

關於 gpt-oss 模型,Ollama 使用的是 OpenAI 提供的官方版本。雖然網路上發現的部分標記為 MXFP4 的 GGUF 檔案在 attention layers 中被進一步量化為 q8_0,但 Ollama 將這些層級維持在 OpenAI 預期的 BF16。

硬體與軟體需求

在 NVIDIA DGX Spark 上獲得最佳效能需要特定的韌體與軟體版本。如果韌體版本低於 580.95.05,Ollama 建議使用 DGX Dashboard 進行更新。

對於偏好命令列介面 (CLI) 的使用者,更新程序需要使用以下順序同時升級 Ubuntu 發行版與韌體:

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot

與 OpenAI Codex 的整合

Ollama 與 OpenAI 的 Codex 運作無縫整合。使用者可以透過 npm 安裝 Codex CLI (npm install -g @openai/codex) 並使用指令 codex --oss --model gpt-oss 來執行模型。

由於 NVIDIA DGX Spark 由 GB10 Grace Blackwell Superchip 提供動力,它提供 120GB 的 VRAM,使得較大的 gpt-oss-120b 模型能完全放入 GPU 記憶體中:

codex --oss --model gpt-oss:120b

Sources

相關