SeldonIO/MLServer
An inference server for your machine learning models, including support for multiple frameworks, multi-model serving and more
解決的問題
MLServer 提供了一種標準化的方式,將機器學習模型部署並作為 API 提供。它消除了開發人員必須為每個模型手動建立自訂 API 包裝器的需求,確保無論底層框架為何,模型都能以一致的介面整合至生產環境中。
工作原理
MLServer 作為一個推論伺服器運作,提供符合 V2 推論協定的 REST 與 gRPC 接口。它使用「推論執行時」作為後端接合元件,將伺服器與特定的機器學習框架(如 Scikit-Learn、XGBoost 或 HuggingFace)連接。此架構允許在同一個程序中執行多個模型,並透過推論工作進程池處理請求。
適用對象
專為需要在生產環境中擴展模型服務的機器學習工程師與 DevOps 專業人員設計,特別是使用 Kubernetes 原生框架(如 Seldon Core 或 KServe)的使用者。
主要特色
- 多模型服務:在同一個程序中執行多個不同模型。
- 自適應批次處理:即時將推論請求分組,以提升吞吐量。
- 平行推論:透過在多個工作進程上執行推論,實現垂直擴展。
- 廣泛框架支援:提供 Scikit-Learn、XGBoost、LightGBM 與 HuggingFace 等流行工具的預打包執行時。
- 標準化協定:REST 與 gRPC 均完全符合 V2 推論協定。
相關
- 專案
- 專案
- 專案
- 專案
- 專案