NVIDIA DGX Spark 使用 Ollama 的性能表现

Ollama 发布了 NVIDIA DGX Spark 的性能基准测试,展示了该硬件使用 Ollama v0.12.6 运行各种大语言模型 (LLMs) 的能力。这些测试证明了 GB10 Grace Blackwell Superchip 的吞吐量能力,特别是其在 120GB VRAM 内处理像 gpt-oss-120b 这样的大型模型的能力。

性能基准测试

Ollama 在 NVIDIA DGX Spark 上的测试显示,在不同的模型架构和量化级别下,预填充 (prefill) 和解码 (decode) 速度各不相同。基准测试使用固件版本 580.95.05 进行,温度设置为 0,禁用了缓存,并将输出限制为 500 个 token。

吞吐量结果

Device Model name Model size Quantization Prefill (tokens/sec) Decode (tokens/sec)
NVIDIA DGX Spark gpt-oss 20B MXFP4 3.224k 58.27
NVIDIA DGX Spark gpt-oss 120B MXFP4 1.169k 41.14
NVIDIA DGX Spark gemma3 12B q4_K_M 1.894k 24.25
NVIDIA DGX Spark gemma3 12B q8_0 1.406k 15.46
NVIDIA DGX Spark gemma3 27B q4_K_M 834.1 10.83
NVIDIA DGX Spark gemma3 27B q8_0 585.4 7.210
NVIDIA DGX Spark llama3.1 8B q4_K_M 7.614k 38.02
NVIDIA DGX Spark llama3.1 8B q8_0 6.110k 25.23
NVIDIA DGX Spark llama3.1 70B q4_K_M 1.911k 4.423
NVIDIA DGX Spark deepseek-r1 14B q4_K_M 5.919k 19.99
NVIDIA DGX Spark deepseek-r1 14B q8_0 4.667k 1.433
NVIDIA DGX Spark qwen3 32B q4_K_M 705.0 9.411
NVIDIA DGX Spark qwen3 32B q8_0 487.2 6.240

技术测试参数

为了确保一致性,每个测试都使用一个提示词进行了 10 次,该提示词要求对书籍《双城记》(A Tale of Two Cities) 的前 200 行进行深入总结。测试脚本及其相关的 readme 可供公开定制。

关于 gpt-oss 模型,Ollama 使用的是 OpenAI 提供的官方版本。虽然在网上发现的一些标记为 MXFP4 的 GGUF 文件在注意力层中被进一步量化为 q8_0,但 Ollama 将这些层保持为 OpenAI 预期的 BF16。

硬件和软件要求

在 NVIDIA DGX Spark 上获得最佳性能需要特定的固件和软件版本。如果固件低于版本 580.95.05,Ollama 建议使用 DGX Dashboard 进行更新。

对于更喜欢命令行界面 (CLI) 的用户,更新过程需要使用以下顺序同时升级 Ubuntu 发行版和固件:

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot

与 OpenAI Codex 的集成

Ollama 与 OpenAI 的 Codex 无缝协作。用户可以通过 npm 安装 Codex CLI (npm install -g @openai/codex) 并使用命令 codex --oss --model gpt-oss 执行模型。

由于 NVIDIA DGX Spark 由 GB10 Grace Blackwell Superchip 提供动力,它提供了 120GB 的 VRAM,允许较大的 gpt-oss-120b 模型完全装入 GPU 显存中:

codex --oss --model gpt-oss:120b

Sources

相关