ome-projects/ome

Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

해결하는 문제

OME (Open Model Engine)는 기업 규모에서 대규모 언어 모델(LLM)을 배포하고 관리하는 복잡한 과정을 단순화합니다. 모델을 적절한 하드웨어와 소프트웨어 런타임에 수동으로 매칭하는 작업을 제거하고, GPU 사용을 최적화하여 비용을 절감하며, Kubernetes에서 모델 서빙의 수명 주기를 자동화합니다.

작동 방식

OME는 커스텀 리소스를 사용하여 모델, 런타임, 하드웨어를 정의하는 Kubernetes Operator로 작동합니다. 시스템은 모델 파일을 자동으로 분석하여 아키텍처와 크기를 확인한 후, 가중치 기반 스코어링 시스템을 사용해 최적의 런타임(SGLang, vLLM, Triton 등)을 선택합니다. Kueue와 KEDA를 포함한 Kubernetes 생태계와 통합되어 고급 스케줄링, 오토스케일링, 트래픽 라우팅을 처리하며, AcceleratorClass 리소스를 사용해 워크로드를 가장 비용 효율적 또는 성능이 뛰어난 GPU에 매칭합니다.

대상 사용자

Kubernetes 클러스터를 통해 프로덕션 수준의 LLM 추론 서비스를 배포하고, 리소스 최적화와 런타임 선택을 자동화하고자 하는 플랫폼 엔지니어 및 ML 엔지니어를 위한 것입니다.

주요 특징

  • 지능형 런타임 선택: 양자화, 포맷, 아키텍처 기반으로 모델을 최적의 추론 엔진에 자동으로 매칭.
  • 기업용 모델 관리: 80개 이상의 모델 패밀리에 걸쳐 분산 저장, 이중 암호화, 자동 복구를 지원.
  • 고급 배포 패턴: 프리필-디코드 분리 및 멀티노드 추론을 가능하게 하여 고성능 서빙을 구현.
  • GPU 비ン패킹: 특수한 스케줄링을 통해 클러스터 효율을 극대화하고 고가용성을 보장.
  • 자동 벤치마킹: 다양한 트래픽 패턴에서 성능을 테스트할 수 있는 내장된 BenchmarkJob 리소스 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트