ome-projects/ome

Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

解决的问题

OME(Open Model Engine)简化了在企业规模上部署和管理大型语言模型(LLMs)的复杂过程。它消除了手动将模型与合适的硬件和软件运行时匹配所需的工作,优化GPU使用以降低成本,并在Kubernetes上自动化模型服务的生命周期管理。

工作原理

OME作为Kubernetes Operator运行,使用自定义资源来定义模型、运行时和硬件。系统会自动解析模型文件以确定其架构和大小,然后使用加权评分系统选择最佳运行时(如SGLang、vLLM或Triton)。它与Kubernetes生态系统(包括Kueue和KEDA)集成,处理高级调度、自动伸缩和流量路由,同时使用AcceleratorClass资源将工作负载与最经济或最强大的GPU匹配。

适用人群

专为平台工程师和ML工程师设计,他们需要在Kubernetes集群上部署生产级别的LLM推理服务,并希望自动化资源优化和运行时选择。

主要亮点

  • 智能运行时选择: 根据量化、格式和架构,自动将模型与最佳推理引擎匹配。
  • 企业级模型管理: 支持跨80多个模型家族的分布式存储、双重加密和自动修复。
  • 高级部署模式: 支持预填充-解码分离和多节点推理,实现高性能服务。
  • GPU分箱打包: 使用专用调度最大化集群效率并确保高可用性。
  • 自动基准测试: 内置BenchmarkJob资源,可在各种流量模式下测试性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目