openvinotoolkit/model_server
A scalable inference server for models optimized with OpenVINO™
What it solves
AI モデルのデプロイを簡素化し、サーバー上でモデルをホストして標準ネットワークプロトコルで提供します。これにより、クライアントアプリケーションはモデルのフレームワーク、ハードウェア、インフラから切り離され、軽量クライアントが実現でき、エンドユーザーにモデルの重みを直接公開せずに更新が容易になります。
How it works
C++ で実装され、Intel アーキテクチャ向けに最適化されたシステムは、gRPC または REST API 経由でリクエストを受け取る推論サーバーとして機能します。ローカルストレージ、オブジェクトストレージ、または HuggingFace Hub からモデルを取得し、OpenVINO で実行できます。OpenAI、Cohere、KServe、TensorFlow Serving などの API をサポートし、ベアメタル、Docker、Kubernetes 上にデプロイ可能です。
Who it’s for
マイクロサービスベースの AI アプリケーションを構築する開発者や DevOps エンジニア向け。エッジやクラウド環境で高性能かつスケーラブルにモデルを提供したい方に最適です。
Highlights
- Broad API Compatibility: テキスト、画像、音声生成のための OpenAI、Cohere、KServe、TensorFlow Serving API をサポート。
- Flexible Deployment: Windows、Linux、Docker、Kubernetes 上で動作。
- Model Management: モデルバージョニングやランタイム更新機能を含む。
- Advanced Scheduling: 複雑なパイプライン向けに DAG スケジューラを提供。
- Multi-Framework Support: TensorFlow、PaddlePaddle、ONNX モデルに対応。