openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

What it solves

它简化了 AI 模型的部署,通过在服务器上托管模型并以标准网络协议提供访问。这使得客户端应用程序与模型框架、硬件和基础设施解耦,允许轻量客户端并在不直接向最终用户暴露模型权重的情况下更容易更新。

How it works

系统使用 C++ 实现,并针对 Intel 架构进行优化,作为一个接受 gRPC 或 REST API 请求的推理服务器。它可以从本地存储、对象存储或 HuggingFace Hub 拉取模型,并使用 OpenVINO 执行。支持多种 API,包括 OpenAI、Cohere、KServe 和 TensorFlow Serving,并可部署在裸金属、Docker 或 Kubernetes 上。

Who it’s for

适用于构建基于微服务的 AI 应用的开发者和 DevOps 工程师,需要一种高性能、可扩展的方式在边缘或云环境中提供模型服务。

Highlights

  • Broad API Compatibility: 支持 OpenAI、Cohere、KServe 和 TensorFlow Serving API,用于文本、图像和语音生成。
  • Flexible Deployment: 可在 Windows、Linux、Docker 和 Kubernetes 上运行。
  • Model Management: 包含模型版本管理和运行时更新等功能。
  • Advanced Scheduling: 提供有向无环图(DAG)调度器以支持复杂流水线。
  • Multi-Framework Support: 兼容 TensorFlow、PaddlePaddle 和 ONNX 模型。