smg-project/smg
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
何が解決されるか
SMG (Shepherd Model Gateway) は、大規模 LLM デプロイメントの管理の複雑さを解決します。開発者が異なるモデルエンジンやクラウドプロバイダー用の複数の分散エンドポイントを管理する必要をなくし、同時に GPU 利用率を最適化し、トラフィック、セキュリティ、オブザーバビリティに対するエンタープライズグレードの制御を提供します。
どのように機能するか
SMG は、エンジンに依存しない高性能なルーティングゲートウェイとして機能します。クライアントに単一の統一エンドポイントを提供し、その後リクエストをさまざまなバックエンドにルーティングします—セルフホスト型エンジン(vLLM、SGLang、TensorRT-LLM など)およびクラウドプロバイダー(OpenAI、Anthropic、Gemini)を含みます。ネイティブ Rust とストリーミング gRPC パイプラインを使用してレイテンシーを最小限に抑えます。効率を最大化するために、キャッシュ対応ルーティングを採用し、ラディックス木で KV-cache 状態を追跡してワーカー間でプレフィックスを再利用します。
誰のために設計されているか
スケールで LLM をデプロイする組織で、ハイブリッド環境(クラウドとセルフホスト)間でトラフィックのバランスを取り、厳格なマルチテナンシーと優先スケジューリングを実装し、推論インフラストラクチャのフルオブザーバビリティを維持する必要がある組織のために設計されています。
ハイライト
- 統一 API:OpenAI、Anthropic、Gemini、xAI をサポートし、さらにどの OpenAI 互換エンドポイントもサポートします。
- キャッシュ対応ルーティング:KV-cache 状態を追跡して、複数のワーカー間で GPU 利用率を最適化します。
- エンタープライズコントロール:優先入場スケジューリング、OIDC 認証、プラグ可能なチャット履歴ストレージを含みます。
- C レベルのパフォーマンス:Rust で構築され、ゼロコピー キャッシュ ヒットとプリフィル/デコードの分離を実現します。
- 拡張性:カスタムロジックのための WebAssembly (WASM) プラグインと、ツール実行のための Model Context Protocol (MCP) 統合をサポートします。
- オブザーバビリティ:90 を超える Prometheus メトリクスと OpenTelemetry トレースを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト