gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

解决的问题

GPUStack 简化了用于 AI 模型服务和实例置备的 GPU 集群管理。它消除了在不同环境(本地、Kubernetes 和云端)中手动配置推理引擎和管理硬件的复杂性,使团队能够像提供服务一样部署和扩展 AI 模型。

工作原理

GPUStack 作为一个编排层来管理多个 GPU 集群。它可以自动选择并配置高性能推理引擎(如 vLLM、SGLang 和 TensorRT-LLM),或者允许使用自定义引擎。该系统包含一个调度器,用于分配 GPU 以实现资源利用率最大化,并提供用于访问已部署模型的 OpenAI 兼容 API。

适用对象

专为需要在各种硬件加速器(NVIDIA、AMD、Ascend 等)上大规模提供模型即服务 (Model-as-a-Service) 的开发团队、IT 组织和服务提供商而设计。

亮点

  • 多集群管理:支持本地、Kubernetes 和云端环境。
  • 可插拔引擎:支持 vLLM、SGLang 和 TensorRT-LLM 的自动化配置,并支持自定义引擎。
  • 性能优化:内置对投机解码 (EAGLE3, MTP, N-grams) 和扩展 KV 缓存系统 (LMCache, HiCache) 的支持。
  • 按需实例:启动可进行 SSH 访问的 GPU 实例,用于开发和微调。
  • 广泛的硬件支持:兼容包括 NVIDIA、AMD、Ascend NPU 在内的多种加速器。
  • 企业级运营:包括自动故障恢复、负载均衡、监控 (Grafana/Prometheus) 和访问控制。