ome-projects/ome
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
What it solves
OME은 엔터프라이즈 규모에서 대형 언어 모델(LLM)을 배포하고 관리하는 복잡한 과정을 단순화합니다. 모델을 적절한 하드웨어와 매칭하고, 최적의 추론 엔진을 선택하며, Kubernetes 클러스터 전반에 걸쳐 GPU 리소스를 효율적으로 관리하는 수작업을 없애줍니다.
How it works
OME은 Kubernetes Operator로 동작하며, 모델을 일급 리소스로 취급합니다. 모델 파일을 자동으로 파싱해 아키텍처와 크기를 파악한 뒤, 가중 점수 시스템을 사용해 모델을 최적의 런타임(SGLang, vLLM, Triton 등)과 최적의 GPU 하드웨어(AcceleratorClass 통해)와 매칭합니다. 모델 다운로드부터 배포까지 전체 라이프사이클을 관리하며, prefill‑decode 디스어그리게이션 및 멀티노드 추론과 같은 고급 패턴을 사용하고, 확장 및 트래픽 라우팅을 위해 Kubernetes 생태계와 통합됩니다.
Who it’s for
Kubernetes에서 프로덕션 급 LLM 서비스를 배포하고, 리소스 최적화와 런타임 선택을 자동화하려는 플랫폼 엔지니어 및 ML Ops 팀을 위한 솔루션입니다.
Highlights
- Intelligent Runtime Selection: 아키텍처와 양자화 방식을 기반으로 모델에 가장 적합한 추론 엔진을 자동 매칭합니다.
- Resource Optimization: 특화된 GPU 빈패킹 및 하드웨어 인식 스케줄링을 활용해 클러스터 효율성을 극대화합니다.
- Advanced Deployment Patterns: 멀티노드 추론 및 prefill‑decode 디스어그리게이트 서빙을 지원합니다.
- Integrated Benchmarking: 다양한 트래픽 패턴에서 모델 성능을 테스트할 수 있는 내장 BenchmarkJob 리소스를 포함합니다.
- Broad Model Support: Llama, Qwen, DeepSeek 등 80여 개 모델 패밀리를 사전 구성합니다.