kserve/kserve
Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes
해결하는 문제
KServe는 Kubernetes에서 생성형 및 예측형 AI 모델을 배포하고 확장할 수 있는 표준화된 방법을 제공합니다. 멀티 프레임워크 배포 관리의 복잡성을 제거하고, 오토스케일링 및 리소스 최적화와 같은 엔터프라이즈 규모 AI 워크로드의 인프라 요구 사항을 처리합니다.
작동 방식
KServe는 다양한 AI 워크로드를 통합하는 추론 플랫폼 역할을 합니다. 생성형 AI의 경우 vLLM 및 llm-d와 같은 최적화된 백엔드를 사용하며 OpenAI 호환 프로토콜을 지원합니다. 예측형 AI의 경우 다양한 프레임워크(TensorFlow, PyTorch, scikit-learn 등)를 지원하며 InferenceGraph를 사용하여 예측기(predictor), 변환기(transformer), 설명기(explainer) 간의 요청 라우팅을 관리합니다. 경량 독립형 서비스, Knative를 통한 서버리스 배포 또는 ModelMesh를 통한 고밀도 배포로 설치할 수 있습니다.
대상 사용자
Kubernetes에서 AI 모델을 대규모로 배포해야 하는 조직 및 개발자를 위해 설계되었으며, 빠른 배포가 필요한 경우부터 고급 트래픽 관리 및 비용 효율적인 리소스 스케일링이 필요한 엔터프라이즈에 이르기까지 다양합니다.
주요 특징
- 통합 추론: 하나의 플랫폼에서 생성형 AI(LLM)와 예측형 AI(전통적 ML)를 모두 지원합니다.
- 생성형 AI 최적화: GPU 가속, CPU/디스크로의 KV 캐시 오프로딩 및 지능형 모델 캐싱을 포함합니다.
- 예측형 AI 도구: 내장된 모델 설명 가능성, 카나리 롤아웃 및 드리프트 및 이상치 탐지를 위한 고급 모니터링을 제공합니다.
- 효율적인 스케일링: 요청 기반 오토스케일링 및 모델이 사용되지 않을 때 인프라 비용을 줄이기 위한 "scale-to-zero"를 지원합니다.
- 폭넓은 호환성: Hugging Face 모델과 PyTorch, TensorFlow, ONNX와 같은 다양한 ML 프레임워크를 네이티브로 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트