openvinotoolkit/model_server
A scalable inference server for models optimized with OpenVINO™
해결하는 문제
OpenVINO Model Server (OVMS)는 네트워크 API를 통해 ML 모델을 배포하고 제공하는 프로덕션 수준의 방법을 제공합니다. Generative AI(LLM, VLM, 이미지 및 오디오 생성)와 전통적인 딥러닝 모델(분류, 객체 탐지, OCR) 모두에 대해 맞춤형 서빙 인프라를 구축할 필요 없이 사용할 수 있습니다.
작동 방식
C++로 작성된 OVMS는 표준 API를 통해 모델을 노출하는 추론 서버로 작동합니다. OpenVINO 툴킷을 활용하여 Intel 하드웨어(CPU, GPU, NPU)에서 모델 실행을 최적화합니다. TensorFlow, ONNX, PaddlePaddle, OpenVINO IR 등 다양한 모델 형식을 지원하며, HuggingFace Hub, S3, GCS, Azure Blob 등의 다양한 리포지토리에서 모델을 가져올 수 있습니다.
대상 사용자
Docker, Kubernetes, 베어메탈 환경 등 Intel 기반 인프라에 모델을 배포하고 싶으며, OpenAI 호환 API(Generative AI용) 및 KServe(전통적 모델용)와 같은 표준 API 호환성을 원하는 개발자 및 ML 엔지니어.
주요 특징
- 광범위한 GenAI 지원: 연속 배치, 스트리밍, 사전 추론을 지원하는 LLM 텍스트 생성은 물론 VLM, 임베딩, 재순서화도 지원.
- 하드웨어 가속: Intel CPU, 통합/디스크리트 GPU, NPU에 특화된 최적화.
- 유연한 배포: Docker 또는 바이너리 패키지를 통해 Linux 및 Windows에서 실행 가능.
- 엔터프라이즈 기능: 모델 버전 관리, 핫리로드, Prometheus 호환 메트릭스를 통한 프로덕션 모니터링 지원.
- 다중 모달 기능: OpenAI 호환 API를 통해 텍스트, 이미지, 오디오, 음성 인식/TTS를 처리.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch