giovtorres/slurm-docker-cluster
A Slurm cluster using docker-compose
解决的问题
Slurm Docker Cluster 提供了一种通过 Docker Compose 快速部署完整功能 Slurm 集群的方法。它消除了高性能计算(HPC)环境复杂的手动设置过程,使开发者无需物理硬件集群即可测试作业调度、开发 HPC 应用程序并管理计算资源。
工作原理
该项目采用多容器架构,将 Slurm 环境的每个组件隔离在独立的容器中。包括用于计费的数据库(MySQL)、用于调度的控制器(slurmctld),以及使用动态注册加入集群的可扩展计算节点(c1、c2 等)。此外还提供可选组件,如用于程序化访问的 REST API、用于 Web 端门户的 Open OnDemand,以及用于作业监控的 Elasticsearch/Kibana 堆栈。
适用人群
专为需要 Slurm 兼容环境进行开发、测试或轻量级使用的开发者和研究人员设计,尤其适合那些需要在多节点间进行作业调度的 HPC 软件或 AI/ML 工作负载的用户。
主要亮点
- 可扩展计算节点: 无需重建集群即可动态扩展 CPU 和 GPU 工作节点。
- GPU 支持: 与 NVIDIA CUDA 基础镜像及 NVIDIA Container Toolkit 集成,实现硬件加速。
- 集成软件管理: 内置 Spack 和 Lmod,便于科学软件包的安装与管理。
- 基于 Web 的管理: 可选的 Open OnDemand 门户,支持浏览器端作业提交与文件管理。
- 多架构支持: 提供 AMD64 和 ARM64 架构的预构建镜像。
相关
- 项目
- 项目
- 项目
- 项目
- 项目