spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems
它解决了什么问题
sparkrun 简化了在 NVIDIA DGX Spark 系统上部署与管理大语言模型(LLM)推理工作负载的流程。它消除了对 Slurm 或 Kubernetes 等复杂编排工具的需求,提供一个精简的命令行界面来启动、管理和停止模型。
它如何工作
该工具使用引导式设置向导来配置集群、建立 SSH 网格,并检测 ConnectX-7 NIC 等硬件。随后用户可以使用来自基于 Git 的注册表中的“配方”来启动推理作业。它会自动通过 SSH 在集群节点之间分发模型和容器,并通过自动检测 InfiniBand/RDMA 支持多节点张量并行。
适用人群
使用 NVIDIA DGX Spark 系统的开发者和研究人员,想要快速部署 LLM 推理工作负载,却不想承担复杂的集群管理软件的开销。
亮点
- 多运行时支持:支持 vLLM、SGLang 和 llama.cpp。
- 多节点张量并行:使用
--tp标志即可轻松在多台主机上扩展。 - 最终阶段显存估算:在启动前预测模型是否能放入内存。
- 基于 Git 的配方注册表:通过 Spark Arena 访问官方、社区和基准配方。
- 自动化设置:引导式向导用于集群创建、SSH 网格和硬件检测。
- 简化分发:自动同步模型和镜像到集群节点。