gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

解决的问题

GPUStack 简化了 AI 模型服务和实例供应的 GPU 集群管理。它消除了手动配置高性能推理引擎以及在不同环境(如本地服务器、Kubernetes 和云提供商)之间协调资源的复杂性。

工作原理

GPUStack 作为一个编排层,管理多个 GPU 集群。它会自动配置并部署可插拔的推理引擎(如 vLLM、SGLang 和 TensorRT-LLM),并针对低延迟或高吞吐量进行优化。系统包含一个调度器,用于分配 GPU 以最大化资源利用率,并提供与 OpenAI 兼容的 API 以访问已部署的模型。

适用人群

专为需要大规模交付 Model-as-a-Service (MaaS) 的开发团队、IT 组织和服务提供商设计,也适用于需要按需 SSH 可访问 GPU 实例进行微调和交互式工作负载的开发者。

主要亮点

  • 多集群管理:在单一视图中支持本地、Kubernetes 和云环境。
  • 可插拔引擎:使用 vLLM、SGLang、TensorRT-LLM 或自定义引擎快速部署新模型。
  • 性能优化:包含预调优模式,支持推测解码(EAGLE3、MTP、N-grams)和扩展 KV 缓存系统(LMCache、HiCache)。
  • 广泛的硬件支持:兼容 NVIDIA、AMD、Ascend、Hygon、MetaX 及其他加速器。
  • 企业级运维:内置认证、访问控制、通过 Grafana/Prometheus 实现实时监控,以及自动故障恢复功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目