smg-project/smg

Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.

何が解決されるか

SMG (Shepherd Model Gateway) は、大規模 LLM デプロイメントの管理の複雑さを解決します。開発者が異なるモデルエンジンやクラウドプロバイダー用の複数の分散エンドポイントを管理する必要をなくし、同時に GPU 利用率を最適化し、トラフィック、セキュリティ、オブザーバビリティに対するエンタープライズグレードの制御を提供します。

どのように機能するか

SMG は、エンジンに依存しない高性能なルーティングゲートウェイとして機能します。クライアントに単一の統一エンドポイントを提供し、その後リクエストをさまざまなバックエンドにルーティングします—セルフホスト型エンジン(vLLM、SGLang、TensorRT-LLM など)およびクラウドプロバイダー(OpenAI、Anthropic、Gemini)を含みます。ネイティブ Rust とストリーミング gRPC パイプラインを使用してレイテンシーを最小限に抑えます。効率を最大化するために、キャッシュ対応ルーティングを採用し、ラディックス木で KV-cache 状態を追跡してワーカー間でプレフィックスを再利用します。

誰のために設計されているか

スケールで LLM をデプロイする組織で、ハイブリッド環境(クラウドとセルフホスト)間でトラフィックのバランスを取り、厳格なマルチテナンシーと優先スケジューリングを実装し、推論インフラストラクチャのフルオブザーバビリティを維持する必要がある組織のために設計されています。

ハイライト

  • 統一 API:OpenAI、Anthropic、Gemini、xAI をサポートし、さらにどの OpenAI 互換エンドポイントもサポートします。
  • キャッシュ対応ルーティング:KV-cache 状態を追跡して、複数のワーカー間で GPU 利用率を最適化します。
  • エンタープライズコントロール:優先入場スケジューリング、OIDC 認証、プラグ可能なチャット履歴ストレージを含みます。
  • C レベルのパフォーマンス:Rust で構築され、ゼロコピー キャッシュ ヒットとプリフィル/デコードの分離を実現します。
  • 拡張性:カスタムロジックのための WebAssembly (WASM) プラグインと、ツール実行のための Model Context Protocol (MCP) 統合をサポートします。
  • オブザーバビリティ:90 を超える Prometheus メトリクスと OpenTelemetry トレースを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト