kserve/kserve
Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes
解决的问题
KServe 提供了一种在 Kubernetes 上部署和扩展生成式及预测式 AI 模型的标准化方法。它消除了管理多框架部署的复杂性,并处理企业级 AI 工作负载的基础设施需求,例如自动扩缩容和资源优化。
工作原理
KServe 作为一个统一不同 AI 工作负载的推理平台发挥作用。对于生成式 AI,它使用经过优化的后端(如 vLLM 和 llm-d)并支持与 OpenAI 兼容的协议。对于预测式 AI,它支持多种框架(TensorFlow、PyTorch、scikit-learn 等),并使用 InferenceGraph 来管理预测器(predictor)、转换器(transformer)和解释器(explainer)之间的请求路由。它可以作为轻量级独立服务、通过 Knative 进行无服务器部署,或通过 ModelMesh 进行高密度部署。
适用对象
专为需要在 Kubernetes 上大规模部署 AI 模型的组织和开发人员设计,涵盖了从需要快速部署的场景到需要高级流量管理和高成本效益资源扩展的企业。
亮点
- 统一推理:在单一平台上同时支持生成式 AI (LLMs) 和预测式 AI (传统 ML)。
- 生成式 AI 优化:包括 GPU 加速、KV 缓存卸载到 CPU/磁盘以及智能模型缓存。
- 预测式 AI 工具:提供内置的模型可解释性、金丝雀发布以及用于漂移和异常检测的高级监控。
- 高效扩缩容:支持基于请求的自动扩缩容以及在模型未使用时降低基础设施成本的“缩减至零 (scale-to-zero)”。
- 广泛的兼容性:原生支持 Hugging Face 模型以及 PyTorch、TensorFlow 和 ONNX 等各种 ML 框架。
相关
- 项目
- 项目
- 项目
- 项目
- 项目