spark-arena/sparkrun

sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems

What it solves

LLM 추론 워크로드를 NVIDIA DGX Spark 시스템에서 배포하고 관리하는 과정을 단순화합니다. Slurm이나 Kubernetes와 같은 복잡한 오케스트레이터의 필요성을 제거하여, 사용자가 단일 명령어로 하나 이상의 노드에 걸쳐 모델을 실행할 수 있도록 합니다.

How it works

Sparkrun은 SSH mesh, sudoers, 네트워크 인터페이스 감지를 포함하여 클러스터를 구성하기 위한 가이드형 설정 마법사를 사용합니다. SSH를 통해 노드 간 모델 및 컨테이너 배포를 관리하며, InfiniBand/RDMA를 자동으로 감지하여 멀티 노드 텐서 병렬 처리를 지원합니다. 또한 Git 기반 레지스트리에서 "recipes"를 활용하여 모델이 어떻게 실행되어야 하는지를 정의합니다.

Who it’s for

전통적인 클러스터 관리 도구의 오버헤드 없이 LLM 추론을 배포하는 간소화된 방법을 원하는 NVIDIA DGX Spark 하드웨어를 사용하는 개발자와 연구자들을 위한 도구입니다.

Highlights

  • Multi-runtime support: vLLM, SGLang, llama.cpp와 함께 작동합니다.
  • Multi-node tensor parallelism: 자동 네트워크 감지를 통해 여러 호스트에 걸쳐 쉽게 확장할 수 있습니다.
  • VRAM estimation: 모델 실행 전 메모리에 적합한지 여부를 예측합니다.
  • Git-based recipe registries: 공식, 커뮤니티 및 벤치마크된 모델 구성에 접근할 수 있습니다.
  • Automated setup: 클러스터 생성, SSH mesh, 하드웨어 감지를 위한 가이드형 마법사를 제공합니다.