openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

解决的问题

OpenVINO Model Server (OVMS) 提供了一种生产级的方式,通过网络 API 部署和提供机器学习模型。它消除了为生成式 AI(大语言模型、视觉语言模型、图像和音频生成)以及传统深度学习模型(分类、目标检测、OCR)构建自定义服务基础设施的需要。

工作原理

使用 C++ 编写的 OVMS 作为推理服务器,通过标准 API 暴露模型。它利用 OpenVINO 工具包在 Intel 硬件(包括 CPU、GPU 和 NPU)上优化模型执行。支持多种模型格式(TensorFlow、ONNX、PaddlePaddle、OpenVINO IR),并可从 HuggingFace Hub、S3、GCS 和 Azure Blob 等多种仓库中拉取模型。

适用人群

需要在基于 Intel 的基础设施(Docker、Kubernetes、裸金属)上部署模型,并希望获得标准 API 兼容性(生成式 AI 使用 OpenAI 兼容,传统模型使用 KServe)的开发者和机器学习工程师。

主要亮点

  • 广泛的生成式 AI 支持:支持 LLM 文本生成,具备连续批处理、流式传输和推测解码功能,同时支持 VLM、嵌入、重排序等。
  • 硬件加速:专为 Intel CPU、集成/独立 GPU 和 NPU 优化。
  • 灵活部署:通过 Docker 或二进制包在 Linux 和 Windows 上运行。
  • 企业级功能:支持模型版本控制、热重载,以及 Prometheus 兼容的指标用于生产监控。
  • 多模态能力:通过 OpenAI 兼容 API 支持文本、图像、音频和语音识别/TTS。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch