gpustack/gpustack
A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.
解決する課題
GPUStackは、AIモデルのサービングとインスタンスプロビジョニングのためのGPUクラスター管理を簡素化します。異なる環境(オンプレミス、Kubernetes、クラウド)にわたる推論エンジンの手動設定やハードウェア管理の複雑さを排除し、チームがAIモデルをサービスとしてデプロイおよびスケールできるようにします。
仕組み
GPUStackは、複数のGPUクラスターを管理するオーケストレーションレイヤーとして機能します。vLLM、SGLang、TensorRT-LLMなどの高性能な推論エンジンを自動的に選択・設定するか、カスタムエンジンを使用することも可能です。システムには、リソース利用率を最大化するためにGPUを割り当てるスケジューラが含まれており、デプロイされたモデルにアクセスするためのOpenAI互換APIを提供します。
対象ユーザー
多様なハードウェアアクセラレータ(NVIDIA、AMD、Ascendなど)にわたって、大規模にModel-as-a-Serviceを提供する必要がある開発チーム、IT組織、およびサービスプロバイダー向けに設計されています。
ハイライト
- マルチクラスター管理: オンプレミス、Kubernetes、およびクラウド環境をサポート。
- プラグイン式エンジン: vLLM、SGLang、TensorRT-LLMの自動設定に加え、カスタムエンジンもサポート。
- パフォーマンスの最適化: Speculative decoding(EAGLE3、MTP、N-grams)および拡張KVキャッシュシステム(LMCache、HiCache)を内蔵。
- オンデマンドインスタンス: 開発やファインチューニング用に、SSHアクセス可能なGPUインスタンスを起動。
- 幅広いハードウェアサポート: NVIDIA、AMD、Ascend NPUなど、幅広いアクセラレータに対応。
- エンタープライズ運用: 自動障害復旧、ロードバランシング、モニタリング(Grafana/Prometheus)、およびアクセス制御を含む。