ome-projects/ome

Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

What it solves

OME 簡化了在企業規模部署與管理大型語言模型(LLM)的複雜流程。它消除手動將模型與適當硬體匹配、選擇最佳推論引擎、以及在 Kubernetes 叢集上有效管理 GPU 資源的工作。

How it works

OME 以 Kubernetes Operator 的形式運作,將模型視為一等資源。它會自動解析模型檔案以了解其架構與大小,接著使用加權評分系統將模型匹配到最佳執行時(如 SGLang、vLLM 或 Triton)以及最佳可用的 GPU 硬體(透過 AcceleratorClass)。它管理從下載模型到部署模型的完整生命週期,使用如 prefill‑decode 解耦與多節點推論等進階模式,並與 Kubernetes 生態系統整合以支援擴展與流量路由。

Who it’s for

平台工程師與 ML Ops 團隊,需在 Kubernetes 上部署生產等級的 LLM 服務,並希望自動化資源最佳化與執行時選擇。

Highlights

  • Intelligent Runtime Selection:自動根據模型的架構與量化方式匹配最佳推論引擎。
  • Resource Optimization:使用專門的 GPU 裝箱與硬體感知排程,最大化叢集效能。
  • Advanced Deployment Patterns:支援多節點推論與 prefill‑decode 解耦服務。
  • Integrated Benchmarking:內建 BenchmarkJob 資源,可在不同流量模式下測試模型效能。
  • Broad Model Support:預先配置超過 80 種模型族群,包括 Llama、Qwen 與 DeepSeek。