Ollama를 사용한 NVIDIA DGX Spark 성능

Ollama는 NVIDIA DGX Spark에 대한 성능 벤치마크를 발표하여, Ollama v0.12.6을 사용하여 광범위한 대규모 언어 모델(LLM)을 실행할 수 있는 하드웨어의 능력을 보여주었습니다. 이러한 테스트는 GB10 Grace Blackwell Superchip의 처리량 성능, 특히 120GB의 VRAM 내에서 gpt-oss-120b와 같은 대형 모델을 처리할 수 있는 능력을 입증합니다.

성능 벤치마크

NVIDIA DGX Spark에 대한 Ollama의 테스트는 다양한 모델 아키텍처와 양자화 수준에 따라 서로 다른 prefill 및 decode 속도를 보여줍니다. 벤치마크는 펌웨어 버전 580.95.05를 사용하고, 온도를 0으로 설정하고, 캐싱을 비활성화하며, 출력을 500 토큰으로 제한하여 수행되었습니다.

처리량 결과

Device Model name Model size Quantization Prefill (tokens/sec) Decode (tokens/sec)
NVIDIA DGX Spark gpt-oss 20B MXFP4 3.224k 58.27
NVIDIA DGX Spark gpt-oss 120B MXFP4 1.169k 41.14
NVIDIA DGX Spark gemma3 12B q4_K_M 1.894k 24.25
NVIDIA DGX Spark gemma3 12B q8_0 1.406k 15.46
NVIDIA DGX Spark gemma3 27B q4_K_M 834.1 10.83
NVIDIA DGX Spark gemma3 27B q8_0 585.4 7.210
NVIDIA DGX Spark llama3.1 8B q4_K_M 7.614k 38.02
NVIDIA DGX Spark llama3.1 8B q8_0 6.110k 25.23
NVIDIA DGX Spark llama3.1 70B q4_K_M 1.911k 4.423
NVIDIA DGX Spark deepseek-r1 14B q4_K_M 5.919k 19.99
NVIDIA DGX Spark deepseek-r1 14B q8_0 4.667k 1.433
NVIDIA DGX Spark qwen3 32B q4_K_M 705.0 9.411
NVIDIA DGX Spark qwen3 32B q8_0 487.2 6.240

기술적 테스트 파라미터

일관성을 보장하기 위해, 각 테스트는

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch