ome-projects/ome

Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

解決的問題

OME(Open Model Engine)簡化了在企業規模上部署與管理大型語言模型(LLMs)的複雜流程。它消除了手動將模型與適當的硬體與軟體執行環境匹配所需的勞力,優化GPU使用以降低營運成本,並在Kubernetes上自動化模型服務的生命周期管理。

作法原理

OME作為Kubernetes Operator運作,使用自訂資源來定義模型、執行環境與硬體。系統會自動解析模型檔案以判斷其架構與大小,再利用加權評分系統,選出最佳執行環境(如SGLang、vLLM或Triton)。它與Kubernetes生態系(包含Kueue與KEDA)整合,處理進階排程、自動擴展與流量路由,同時使用AcceleratorClass資源,將工作負載匹配至最具成本效益或效能的GPU。

適用對象

專為平台工程師與ML工程師設計,他們需要在Kubernetes叢集上部署生產級LLM推理服務,並希望自動化資源優化與執行環境選擇。

主要特色

  • 智慧執行環境選擇: 根據量化、格式與架構,自動將模型匹配至最佳推理引擎。
  • 企業級模型管理: 支援跨80多個模型家族的分散式儲存、雙重加密與自動修復。
  • 進階部署模式: 支援預填入-解碼分離與多節點推理,實現高效率服務。
  • GPU分箱打包: 使用專用排程最大化叢集效率,並確保高可用性。
  • 自動基準測試: 內建BenchmarkJob資源,可在各種流量模式下測試效能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案