openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

何を解決するか

OpenVINO Model Server (OVMS) は、ネットワークAPI経由でMLモデルをデプロイおよび配信するためのプロダクション対応の方法を提供します。Generative AI(LLM、VLM、画像および音声生成)および従来のディープラーニングモデル(分類、物体検出、OCR)の両方について、カスタムサーバインフラを構築する必要がありません。

動作方法

C++で記述されたOVMSは、標準APIを介してモデルを公開する推論サーバとして機能します。OpenVINOツールキットを活用して、Intelハードウェア(CPU、GPU、NPU)上でモデル実行を最適化します。複数のモデル形式(TensorFlow、ONNX、PaddlePaddle、OpenVINO IR)をサポートし、HuggingFace Hub、S3、GCS、Azure Blobなど、さまざまなリポジトリからモデルを取得できます。

対象ユーザー

Intelベースのインフラ(Docker、Kubernetes、ベアメタル)にモデルをデプロイしたい開発者およびMLエンジニアで、標準API互換性(GenAI用OpenAI互換、従来モデル用KServe)を求める方。

主な特徴

  • 広範なGenAIサポート:連続バッチ処理、ストリーミング、推測デコードを備えたLLMテキスト生成に加え、VLM、埋め込み、再ランク付けも対応。
  • ハードウェアアクセラレーション:Intel CPU、統合/デスクトップGPU、NPUに特化して最適化。
  • 柔軟なデプロイ:DockerまたはバイナリパッケージでLinuxおよびWindowsで実行可能。
  • エンタープライズ機能:モデルバージョニング、ホットリロード、Prometheus互換メトリクスによるプロダクション監視をサポート。
  • マルチモーダル対応:OpenAI互換APIを介してテキスト、画像、音声、音声認識/TTSを処理。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch