SeldonIO/MLServer

An inference server for your machine learning models, including support for multiple frameworks, multi-model serving and more

해결하는 문제

MLServer는 기계학습 모델을 API로 배포하고 제공하는 표준화된 방법을 제공합니다. 개발자가 각 모델에 대해 수동으로 맞춤형 API 래퍼를 구축할 필요가 없으며, 기반 프레임워크에 관계없이 일관된 인터페이스를 통해 모델을 생산 환경에 통합할 수 있습니다.

작동 방식

MLServer는 V2 추론 프로토콜에 준거하는 REST 및 gRPC 인터페이스를 노출하는 추론 서버로 작동합니다. "추론 런타임"이라는 백엔드 연결 요소를 사용하여 서버와 특정 기계학습 프레임워크(예: Scikit-Learn, XGBoost, HuggingFace 등)를 연결합니다. 이 아키텍처는 단일 프로세스 내에서 여러 모델을 실행하고, 추론 워커 풀을 통해 요청을 처리할 수 있게 합니다.

대상 사용자

Kubernetes 기반 프레임워크(Seldon Core 또는 KServe 등)를 사용하는 기계학습 엔지니어 및 DevOps 전문가를 위한 것입니다. 특히 생산 환경에서 모델 서빙을 확장해야 하는 경우에 적합합니다.

주요 특징

  • 다중 모델 서빙: 동일한 프로세스 내에서 다양한 모델을 동시에 실행 가능.
  • 적응형 배치 처리: 실시간으로 추론 요청을 그룹화하여 처리량을 향상.
  • 병렬 추론: 여러 워커를 통해 수직 확장하여 추론을 수행.
  • 광범위한 프레임워크 지원: Scikit-Learn, XGBoost, LightGBM, HuggingFace 등 인기 도구에 대한 사전 패키지 런타임 제공.
  • 표준 프로토콜 준수: REST 및 gRPC 모두에서 V2 추론 프로토콜에 완전히 준수.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트