openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

What it solves

AI モデルのデプロイを簡素化し、サーバー上でモデルをホストして標準ネットワークプロトコルで提供します。これにより、クライアントアプリケーションはモデルのフレームワーク、ハードウェア、インフラから切り離され、軽量クライアントが実現でき、エンドユーザーにモデルの重みを直接公開せずに更新が容易になります。

How it works

C++ で実装され、Intel アーキテクチャ向けに最適化されたシステムは、gRPC または REST API 経由でリクエストを受け取る推論サーバーとして機能します。ローカルストレージ、オブジェクトストレージ、または HuggingFace Hub からモデルを取得し、OpenVINO で実行できます。OpenAI、Cohere、KServe、TensorFlow Serving などの API をサポートし、ベアメタル、Docker、Kubernetes 上にデプロイ可能です。

Who it’s for

マイクロサービスベースの AI アプリケーションを構築する開発者や DevOps エンジニア向け。エッジやクラウド環境で高性能かつスケーラブルにモデルを提供したい方に最適です。

Highlights

  • Broad API Compatibility: テキスト、画像、音声生成のための OpenAI、Cohere、KServe、TensorFlow Serving API をサポート。
  • Flexible Deployment: Windows、Linux、Docker、Kubernetes 上で動作。
  • Model Management: モデルバージョニングやランタイム更新機能を含む。
  • Advanced Scheduling: 複雑なパイプライン向けに DAG スケジューラを提供。
  • Multi-Framework Support: TensorFlow、PaddlePaddle、ONNX モデルに対応。