openvinotoolkit/model_server
A scalable inference server for models optimized with OpenVINO™
解決的問題
OpenVINO Model Server (OVMS) 提供了一種生產級的方式,透過網路 API 部署與提供機器學習模型。它消除了為生成式 AI(大型語言模型、視覺語言模型、影像與音訊生成)以及傳統深度學習模型(分類、物件偵測、OCR)建立自訂服務基礎設施的需要。
工作原理
以 C++ 編寫的 OVMS 作為推論伺服器,透過標準 API 暴露模型。它利用 OpenVINO 工具包在 Intel 硬體(包括 CPU、GPU 和 NPU)上優化模型執行。支援多種模型格式(TensorFlow、ONNX、PaddlePaddle、OpenVINO IR),並可從 HuggingFace Hub、S3、GCS 和 Azure Blob 等多種倉儲拉取模型。
適用對象
需要在基於 Intel 的基礎設施(Docker、Kubernetes、裸機)上部署模型,並希望獲得標準 API 相容性(生成式 AI 使用 OpenAI 相容,傳統模型使用 KServe)的開發者與機器學習工程師。
主要亮點
- 廣泛的生成式 AI 支援:支援 LLM 文字生成,具備連續批次、串流與推測解碼功能,同時支援 VLM、嵌入、重排序等。
- 硬體加速:專為 Intel CPU、整合/獨立 GPU 與 NPU 優化。
- 彈性部署:透過 Docker 或二進位套件在 Linux 與 Windows 上執行。
- 企業級功能:支援模型版本控制、熱重載,以及 Prometheus 相容的指標用於生產監控。
- 多模態能力:透過 OpenAI 相容 API 支援文字、影像、音訊與語音辨識/TTS。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch