SeldonIO/MLServer

An inference server for your machine learning models, including support for multiple frameworks, multi-model serving and more

何を解決するか

MLServerは、機械学習モデルをAPIとしてデプロイおよび配信するための標準化された方法を提供します。開発者が各モデルに対して手動でカスタムAPIラッパーを構築する必要がなくなり、基盤となるフレームワークにかかわらず、一貫したインターフェースでモデルを本番環境に統合できるようになります。

動作方法

MLServerは、V2推論プロトコルに準拠したRESTおよびgRPCインターフェースを公開する推論サーバーとして機能します。"推論ランタイム"と呼ばれるバックエンドの接続部品を使用して、サーバーと特定の機械学習フレームワーク(Scikit-Learn、XGBoost、HuggingFaceなど)を接続します。このアーキテクチャにより、単一のプロセス内で複数のモデルを実行でき、推論ワーカーのプールを通じてリクエストを処理できます。

対象ユーザー

Kubernetesネイティブなフレームワーク(Seldon CoreやKServeなど)を使用している、本番環境でのモデル配信をスケーリングしたい機械学習エンジニアおよびDevOpsプロフェッショナル向けに設計されています。

主な特徴

  • マルチモデル配信: 同じプロセス内で複数の異なるモデルを実行可能。
  • 適応型バッチ処理: 実行時に推論リクエストを動的にグループ化し、スループットを向上。
  • 並列推論: 複数のワーカーで推論を実行することで垂直スケーリングを実現。
  • 広範なフレームワーク対応: Scikit-Learn、XGBoost、LightGBM、HuggingFaceなど人気ツールの事前パッケージ化されたランタイムを提供。
  • 標準化プロトコル: RESTおよびgRPCの両方でV2推論プロトコルに完全準拠。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト