openvinotoolkit/model_server

A scalable inference server for models optimized with OpenVINO™

What it solves

AI 모델 배포를 간소화하여 서버에 모델을 호스팅하고 표준 네트워크 프로토콜을 통해 접근할 수 있게 합니다. 이를 통해 클라이언트 애플리케이션은 모델 프레임워크, 하드웨어 및 인프라와 분리되어 경량 클라이언트를 구현할 수 있으며, 최종 사용자에게 모델 가중치를 직접 노출하지 않고도 업데이트가 용이합니다.

How it works

C++ 로 구현되고 Intel 아키텍처에 최적화된 시스템은 gRPC 또는 REST API 로 요청을 받는 추론 서버 역할을 합니다. 로컬 스토리지, 객체 스토리지 또는 HuggingFace Hub 에서 모델을 가져와 OpenVINO 로 실행합니다. OpenAI, Cohere, KServe, TensorFlow Serving 등 다양한 API 를 지원하며 베어 메탈, Docker, Kubernetes 에 배포할 수 있습니다.

Who it’s for

마이크로서비스 기반 AI 애플리케이션을 구축하는 개발자와 DevOps 엔지니어를 위한 솔루션으로, 엣지 또는 클라우드 환경에서 고성능·확장 가능한 모델 서비스를 필요로 하는 경우에 적합합니다.

Highlights

  • Broad API Compatibility: 텍스트, 이미지, 음성 생성용 OpenAI, Cohere, KServe, TensorFlow Serving API 를 지원합니다.
  • Flexible Deployment: Windows, Linux, Docker, Kubernetes 에서 실행됩니다.
  • Model Management: 모델 버전 관리 및 런타임 업데이트 기능을 포함합니다.
  • Advanced Scheduling: 복잡한 파이프라인을 위한 DAG 스케줄러를 제공합니다.
  • Multi-Framework Support: TensorFlow, PaddlePaddle, ONNX 모델과 호환됩니다.