ome-projects/ome
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
What it solves
OME 简化了在企业规模部署与管理大型语言模型(LLM)的复杂过程。它消除手动将模型与合适硬件匹配、选择最佳推理引擎以及在 Kubernetes 集群上高效管理 GPU 资源的工作。
How it works
OME 作为 Kubernetes Operator 运行,将模型视为一等资源。它会自动解析模型文件以了解其架构和大小,然后使用加权评分系统将模型匹配到最佳运行时(如 SGLang、vLLM 或 Triton)以及最佳可用的 GPU 硬件(通过 AcceleratorClass)。它管理从下载模型到部署模型的完整生命周期,使用如 prefill‑decode 解耦和多节点推理等高级模式,并与 Kubernetes 生态系统集成以实现扩展和流量路由。
Who it’s for
平台工程师和 ML Ops 团队,需要在 Kubernetes 上部署生产级 LLM 服务,并希望自动化资源优化和运行时选择。
Highlights
- Intelligent Runtime Selection:自动根据模型的架构和量化方式匹配最佳推理引擎。
- Resource Optimization:使用专用的 GPU 装箱和硬件感知调度,最大化集群效率。
- Advanced Deployment Patterns:支持多节点推理和 prefill‑decode 解耦服务。
- Integrated Benchmarking:内置 BenchmarkJob 资源,可在不同流量模式下测试模型性能。
- Broad Model Support:预配置超过 80 种模型族群,包括 Llama、Qwen 和 DeepSeek。