ome-projects/ome

Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

何を解決するか

OME (Open Model Engine) は、企業規模での大規模言語モデル (LLMs) のデプロイと管理という複雑なプロセスを簡素化します。モデルを適切なハードウェアとソフトウェアランタイムにマッチさせるための手動作業を排除し、GPUの使用を最適化してコストを削減し、Kubernetes上でモデルサービングのライフサイクルを自動化します。

動作方法

OME はカスタムリソースを使用してモデル、ランタイム、ハードウェアを定義するKubernetes Operatorとして動作します。システムは自動的にモデルファイルを解析し、アーキテクチャとサイズを特定した後、重み付きスコアリングシステムを使用して最適なランタイム(SGLang、vLLM、Tritonなど)を選択します。KueueやKEDAを含むKubernetesエコシステムと統合され、高度なスケジューリング、オートスケーリング、トラフィックルーティングを処理し、AcceleratorClassリソースを使用してワークロードを最もコスト効率的または高性能なGPUにマッチさせます。

対象ユーザー

Kubernetesクラスタ上でプロダクションレベルのLLM推論サービスを展開し、リソース最適化とランタイム選択を自動化したいプラットフォームエンジニアおよびMLエンジニア向けに設計されています。

主な特徴

  • インテリジェントなランタイム選択: 量子化、フォーマット、アーキテクチャに基づいてモデルを最適な推論エンジンに自動的にマッチ。
  • 企業向けモデル管理: 80以上のモデルファミリーにわたる分散ストレージ、二重暗号化、自動修復をサポート。
  • 高度なデプロイパターン: プレフィル-デコードの分離とマルチノード推論を可能にし、高性能なサービングを実現。
  • GPUビンパッキング: 特殊なスケジューリングによりクラスタ効率を最大化し、高可用性を確保。
  • 自動ベンチマーク: さまざまなトラフィックパターン下でのパフォーマンスをテストするための組み込みBenchmarkJobリソースを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト