kserve/kserve
Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes
解決的問題
KServe 提供了一種在 Kubernetes 上部署與擴展生成式及預測式 AI 模型的標準化方法。它消除了管理多框架部署的複雜性,並處理企業級 AI 工作負載的基礎設施需求,例如自動擴縮容與資源優化。
工作原理
KServe 作為一個統一不同 AI 工作負載的推理平台發揮作用。對於生成式 AI,它使用經過優化的後端(如 vLLM 與 llm-d)並支援與 OpenAI 相容的協定。對於預測式 AI,它支援多種框架(TensorFlow、PyTorch、scikit-learn 等),並使用 InferenceGraph 來管理預測器(predictor)、轉換器(transformer)與解釋器(explainer)之間的請求路由。它可以作為輕量級獨立服務、透過 Knative 進行無伺服器部署,或透過 ModelMesh 進行高密度部署。
適用對象
專為需要在 Kubernetes 上大規模部署 AI 模型的組織與開發人員設計,涵蓋了從需要快速部署的場景到需要進階流量管理與高成本效益資源擴展的企業。
亮點
- 統一推理:在單一平台上同時支援生成式 AI (LLMs) 與預測式 AI (傳統 ML)。
- 生成式 AI 優化:包括 GPU 加速、KV 快取卸載至 CPU/磁碟以及智慧模型快取。
- 預測式 AI 工具:提供內建的模型可解釋性、金絲雀發佈以及用於漂移與異常檢測的高階監控。
- 高效擴縮容:支援基於請求的自動擴縮容以及在模型未使用時降低基礎設施成本的「縮減至零 (scale-to-zero)」。
- 廣泛的相容性:原生支援 Hugging Face 模型以及 PyTorch、TensorFlow 與 ONNX 等各種 ML 框架。
相關
- 專案
- 專案
- 專案
- 專案
- 專案