gpustack/gpustack
A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.
해결하는 문제
GPUStack은 AI 모델 서빙 및 인스턴스 프로비저닝을 위한 GPU 클러스터 관리를 단순화합니다. 온프레미스, Kubernetes 및 클라우드와 같은 다양한 환경에서 추론 엔진을 수동으로 구성하고 하드웨어를 관리하는 복잡성을 제거하여, 팀이 AI 모델을 서비스로 배포하고 확장할 수 있도록 합니다.
작동 방식
GPUStack은 여러 GPU 클러스터를 관리하는 오케스트레이션 레이어 역할을 합니다. vLLM, SGLang, TensorRT-LLM과 같은 고성능 추론 엔진을 자동으로 선택하고 구성하거나 사용자 정의 엔진을 허용합니다. 시스템에는 리소스 활용도를 극대화하기 위해 GPU를 할당하는 스케줄러가 포함되어 있으며, 배포된 모델에 액세스하기 위한 OpenAI 호환 API를 제공합니다.
대상 사용자
다양한 하드웨어 가속기(NVIDIA, AMD, Ascend 등)를 통해 대규모로 Model-as-a-Service를 제공해야 하는 개발 팀, IT 조직 및 서비스 제공업체를 위해 설계되었습니다.
주요 특징
- 멀티 클러스터 관리: 온프레미스, Kubernetes 및 클라우드 환경 지원.
- 플러그형 엔진: vLLM, SGLang, TensorRT-LLM의 자동 구성 및 사용자 정의 엔진 지원.
- 성능 최적화: Speculative decoding(EAGLE3, MTP, N-grams) 및 확장 KV 캐시 시스템(LMCache, HiCache) 내장 지원.
- 온디맨드 인스턴스: 개발 및 미세 조정을 위한 SSH 접속 가능 GPU 인스턴스 실행.
- 폭넓은 하드웨어 지원: NVIDIA, AMD, Ascend NPU를 포함한 광범위한 가속기와 호환.
- 엔터프라이즈 운영: 자동 장애 복구, 부하 분산, 모니터링(Grafana/Prometheus) 및 액세스 제어 포함.