ome-projects/ome
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
What it solves
OME は、エンタープライズ規模で大規模言語モデル(LLM)をデプロイ・管理する複雑なプロセスを簡素化します。モデルと適切なハードウェアのマッチング、最適な推論エンジンの選択、Kubernetes クラスタ全体での GPU リソースの効率的な管理に必要な手作業を排除します。
How it works
OME は Kubernetes Operator として動作し、モデルをファーストクラスリソースとして扱います。モデルファイルを自動的に解析してアーキテクチャとサイズを把握し、加重スコアリングシステムを用いて最適なランタイム(SGLang、vLLM、Triton など)と最適な GPU ハードウェア(AcceleratorClass 経由)にマッチングします。モデルのダウンロードからデプロイまでのライフサイクル全体を管理し、prefill‑decode ディスアグリゲーションやマルチノード推論といった高度なパターンを使用し、スケーリングやトラフィックルーティングのために Kubernetes エコシステムと統合します。
Who it’s for
Kubernetes 上で本番レベルの LLM サービスをデプロイし、リソース最適化とランタイム選択を自動化したいプラットフォームエンジニアや ML Ops チーム向けです。
Highlights
- Intelligent Runtime Selection:アーキテクチャと量子化に基づき、モデルに最適な推論エンジンを自動的にマッチング。
- Resource Optimization:GPU のビンパッキングとハードウェア認識スケジューリングを活用し、クラスタ効率を最大化。
- Advanced Deployment Patterns:マルチノード推論と prefill‑decode ディスアグリゲートされた提供をサポート。
- Integrated Benchmarking:様々なトラフィックパターン下でモデル性能をテストする組み込みの BenchmarkJob リソースを含む。
- Broad Model Support:Llama、Qwen、DeepSeek など、80 以上のモデルファミリーに事前構成済み。