SeldonIO/MLServer
An inference server for your machine learning models, including support for multiple frameworks, multi-model serving and more
解决的问题
MLServer 提供了一种标准化的方式来部署和提供机器学习模型作为 API。它消除了开发人员为每个模型手动构建自定义 API 包装器的需求,确保无论底层框架如何,模型都可以使用一致的接口集成到生产环境中。
工作原理
MLServer 作为一个推理服务器运行,提供符合 V2 推理协议的 REST 和 gRPC 接口。它使用“推理运行时”作为后端连接器,将服务器与特定的机器学习框架(如 Scikit-Learn、XGBoost 或 HuggingFace)连接起来。这种架构允许在单个进程中运行多个模型,并通过推理工作线程池处理请求。
适用人群
专为需要在生产环境中扩展模型服务的机器学习工程师和 DevOps 专业人员设计,特别是使用 Kubernetes 原生框架(如 Seldon Core 或 KServe)的用户。
主要亮点
- 多模型服务:在同一进程中运行多个不同模型。
- 自适应批处理:实时对推理请求进行分组,以提高吞吐量。
- 并行推理:通过在多个工作线程上运行推理实现垂直扩展。
- 广泛框架支持:提供 Scikit-Learn、XGBoost、LightGBM 和 HuggingFace 等流行工具的预打包运行时。
- 标准化协议:REST 和 gRPC 均完全符合 V2 推理协议。
相关
- 项目
- 项目
- 项目
- 项目
- 项目