openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

What it solves

它簡化了 AI 模型的部署,透過在伺服器上託管模型並以標準網路協定提供存取。這使得客戶端應用程式與模型框架、硬體與基礎設施解耦,讓客戶端可以更輕量,且在不直接向最終使用者暴露模型權重的情況下,輕鬆進行更新。

How it works

此系統以 C++ 實作,並針對 Intel 架構進行最佳化,作為一個接受 gRPC 或 REST API 請求的推論伺服器。它可以從本機儲存、物件儲存或 HuggingFace Hub 拉取模型,並使用 OpenVINO 執行。支援多種 API,包括 OpenAI、Cohere、KServe 與 TensorFlow Serving,且可部署於裸機、Docker 或 Kubernetes 上。

Who it’s for

適合開發者與 DevOps 工程師,構建基於微服務的 AI 應用,需要高效能、可擴展的方式在邊緣或雲端環境中提供模型服務。

Highlights

  • Broad API Compatibility: 支援 OpenAI、Cohere、KServe 與 TensorFlow Serving API,用於文字、影像與語音生成。
  • Flexible Deployment: 可在 Windows、Linux、Docker 與 Kubernetes 上執行。
  • Model Management: 包含模型版本管理與執行時更新等功能。
  • Advanced Scheduling: 提供有向無環圖(DAG)排程器以支援複雜管線。
  • Multi-Framework Support: 相容 TensorFlow、PaddlePaddle 與 ONNX 模型。