spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD
해결하는 문제
Sparkrun은 NVIDIA DGX Spark 시스템에서 LLM 추론 워크로드를 배포하고 관리하는 것을 간소화합니다. Slurm이나 Kubernetes와 같은 복잡한 오케스트레이션 도구가 필요 없으며, 모델을 시작하고 관리하기 위한 간결한 명령줄 인터페이스를 제공합니다.
작동 방식
Sparkrun은 클러스터 구성, SSH 메시, 하드웨어 감지(예: ConnectX-7 NIC)를 위한 안내형 설정 워즈드를 사용합니다. SSH를 통해 클러스터 노드 간 모델과 컨테이너를 분배하고, 멀티노드 텐서 병렬 처리를 지원합니다. 사용자는 공식 또는 커뮤니티 레지스트리에서 GitHub에 호스팅된 최적화된 구성 설정을 가져올 수 있는 레시피 기반 시스템을 활용합니다.
대상 사용자
NVIDIA DGX Spark 하드웨어를 사용하여 LLM 추론 엔진을 빠르게 배포하고자 하며, 전통적인 클러스터 관리 소프트웨어의 부담을 피하고자 하는 개발자 및 연구자에게 적합합니다.
주요 기능
- 다중 런타임 지원: vLLM, SGLang, llama.cpp를 기본적으로 지원합니다.
- 멀티노드 텐서 병렬 처리: InfiniBand/RDMA를 자동 감지하여 여러 호스트에 걸쳐 확장합니다.
- VRAM 추정: 모델이 메모리에 맞는지 시작 전에 예측합니다.
- Git 기반 레시피 레지스트리: 공식, 커뮤니티, 벤치마크된 레시피에 접근하여 최적화된 모델 배포가 가능합니다.
- 자동 설정: 클러스터 생성, SSH 메시, 시스템 구성에 대한 안내형 워즈드를 제공합니다.
- 모델 분배: 모델과 이미지를 클러스터 노드에 자동으로 동기화합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트