SeldonIO/MLServer

An inference server for your machine learning models, including support for multiple frameworks, multi-model serving and more

解決的問題

MLServer 提供了一種標準化的方式,將機器學習模型部署並作為 API 提供。它消除了開發人員必須為每個模型手動建立自訂 API 包裝器的需求,確保無論底層框架為何,模型都能以一致的介面整合至生產環境中。

工作原理

MLServer 作為一個推論伺服器運作,提供符合 V2 推論協定的 REST 與 gRPC 接口。它使用「推論執行時」作為後端接合元件,將伺服器與特定的機器學習框架(如 Scikit-Learn、XGBoost 或 HuggingFace)連接。此架構允許在同一個程序中執行多個模型,並透過推論工作進程池處理請求。

適用對象

專為需要在生產環境中擴展模型服務的機器學習工程師與 DevOps 專業人員設計,特別是使用 Kubernetes 原生框架(如 Seldon Core 或 KServe)的使用者。

主要特色

  • 多模型服務:在同一個程序中執行多個不同模型。
  • 自適應批次處理:即時將推論請求分組,以提升吞吐量。
  • 平行推論:透過在多個工作進程上執行推論,實現垂直擴展。
  • 廣泛框架支援:提供 Scikit-Learn、XGBoost、LightGBM 與 HuggingFace 等流行工具的預打包執行時。
  • 標準化協定:REST 與 gRPC 均完全符合 V2 推論協定。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案