lightseekorg/smg
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
What it solves
Shepherd Model Gateway(SMG)は、大規模 LLM インフラのデプロイを簡素化し、集中型ルーティング層を提供します。モデルやプロバイダーごとに分散したエンドポイントを管理する必要がなくなり、GPU の低利用やトラフィックスパイク、ハイブリッド(クラウドとセルフホスト)環境での統一された可観測性の欠如といった一般的な本番課題を解決します。
How it works
SMG はエンジン非依存のゲートウェイとして、ユーザーと推論ワーカーの間に位置します。単一の統一 API を用いて、vLLM や SGLang といったセルフホストエンジンや OpenAI、Anthropic といったクラウドプロバイダーなど、さまざまなバックエンドへリクエストをルーティングします。パフォーマンス最適化のため、キャッシュ認識ルーティングを採用し、ワーカー間で KV キャッシュプレフィックスを再利用して冗長計算を削減します。システムは Rust で実装され高性能を実現し、gRPC パイプラインでストリーミングとツールパースを行い、SWIM プロトコルに基づく高可用性メッシュネットワークでマルチノードスケーリングを可能にします。
Who it’s for
大規模に LLM をデプロイするエンジニアや組織向けで、高性能かつエンタープライズ向けのトラフィックバランシング、ワーカーライフサイクル管理、プライバシーと履歴保存の厳格なコントロールが必要な方に最適です。
Highlights
- Cache-Aware Routing: 基礎となる推論エンジンの KV キャッシュ状態を把握し、GPU 利用率を最適化します。
- Unified API: OpenAI、Anthropic、Gemini、Bedrock、各種セルフホストバックエンド向けに単一エンドポイントを提供します。
- Enterprise-Grade Control: マルチテナントレートリミット、OIDC 認証、カスタムロジック用の WebAssembly(WASM)プラグインを含みます。
- High Availability: サーキットブレーカーと自動フェイルオーバーを備えたメッシュネットワークアーキテクチャです。
- Pluggable Storage: PostgreSQL、Oracle、Redis など、複数のチャット履歴バックエンドをサポートします。