spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD
它解决了什么问题
Sparkrun 简化了在 NVIDIA DGX Spark 系统上部署和管理大语言模型(LLM)推理工作负载的过程。它消除了对复杂编排工具(如 Slurm 或 Kubernetes)的需求,提供了一个简化的命令行界面,用于启动和管理模型。
它如何工作
Sparkrun 使用引导式设置向导来配置集群、SSH 网络和硬件检测(例如 ConnectX-7 网卡)。它通过 SSH 管理模型和容器在集群节点间的分发,并支持多节点张量并行。它采用基于配方的系统,用户可以从 GitHub 上托管的官方或社区注册表中拉取优化的配置。
适用人群
专为使用 NVIDIA DGX Spark 硬件的开发者和研究人员设计,他们希望快速部署 LLM 推理引擎,而无需承担传统集群管理软件的开销。
主要特性
- 多运行时支持:开箱即用支持 vLLM、SGLang 和 llama.cpp。
- 多节点张量并行:自动检测 InfiniBand/RDMA,实现跨多个主机的扩展。
- VRAM 估算:在启动前预测模型是否能适配内存。
- 基于 Git 的配方注册表:可访问官方、社区及经过基准测试的配方,用于优化模型部署。
- 自动化设置:通过引导式向导完成集群创建、SSH 网络和系统配置。
- 模型分发:自动将模型和镜像同步到集群节点。
"Sparkrun 让在 DGX Spark 上运行 LLM 推理变得像运行一个命令一样简单。" — @sparkrun
相关
- 项目
- 项目
- 项目
- 项目
- 项目