Ollama를 사용한 NVIDIA DGX Spark 성능
Ollama는 NVIDIA DGX Spark에 대한 성능 벤치마크를 발표하여, Ollama v0.12.6을 사용하여 광범위한 대규모 언어 모델(LLM)을 실행할 수 있는 하드웨어의 능력을 보여주었습니다. 이러한 테스트는 GB10 Grace Blackwell Superchip의 처리량 성능, 특히 120GB의 VRAM 내에서 gpt-oss-120b와 같은 대형 모델을 처리할 수 있는 능력을 입증합니다.
성능 벤치마크
NVIDIA DGX Spark에 대한 Ollama의 테스트는 다양한 모델 아키텍처와 양자화 수준에 따라 서로 다른 prefill 및 decode 속도를 보여줍니다. 벤치마크는 펌웨어 버전 580.95.05를 사용하고, 온도를 0으로 설정하고, 캐싱을 비활성화하며, 출력을 500 토큰으로 제한하여 수행되었습니다.
처리량 결과
| Device | Model name | Model size | Quantization | Prefill (tokens/sec) | Decode (tokens/sec) |
|---|---|---|---|---|---|
| NVIDIA DGX Spark | gpt-oss | 20B | MXFP4 | 3.224k | 58.27 |
| NVIDIA DGX Spark | gpt-oss | 120B | MXFP4 | 1.169k | 41.14 |
| NVIDIA DGX Spark | gemma3 | 12B | q4_K_M | 1.894k | 24.25 |
| NVIDIA DGX Spark | gemma3 | 12B | q8_0 | 1.406k | 15.46 |
| NVIDIA DGX Spark | gemma3 | 27B | q4_K_M | 834.1 | 10.83 |
| NVIDIA DGX Spark | gemma3 | 27B | q8_0 | 585.4 | 7.210 |
| NVIDIA DGX Spark | llama3.1 | 8B | q4_K_M | 7.614k | 38.02 |
| NVIDIA DGX Spark | llama3.1 | 8B | q8_0 | 6.110k | 25.23 |
| NVIDIA DGX Spark | llama3.1 | 70B | q4_K_M | 1.911k | 4.423 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q4_K_M | 5.919k | 19.99 |
| NVIDIA DGX Spark | deepseek-r1 | 14B | q8_0 | 4.667k | 1.433 |
| NVIDIA DGX Spark | qwen3 | 32B | q4_K_M | 705.0 | 9.411 |
| NVIDIA DGX Spark | qwen3 | 32B | q8_0 | 487.2 | 6.240 |
기술적 테스트 파라미터
일관성을 보장하기 위해, 각 테스트는
Sources
- OriginalNVIDIA DGX Spark performance
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch