lightseekorg/smg
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
What it solves
Shepherd Model Gateway (SMG) 簡化了大規模 LLM 基礎設施的部署,提供集中式路由層。它消除需要為不同模型與供應商管理多個分散端點的需求,同時解決 GPU 利用率不足、流量突增以及混合(雲端與自建)環境缺乏統一可觀測性的常見生產問題。
How it works
SMG 作為一個與引擎無關的閘道,位於使用者與推論工作者之間。它使用單一統一 API,將請求路由至各種後端——包括自建引擎如 vLLM、SGLang,或雲端供應商如 OpenAI、Anthropic。為了優化效能,它採用快取感知路由,重複使用工作者之間的 KV 快取前綴,減少冗餘計算。系統以 Rust 建置以確保高效能,並使用 gRPC 管道進行串流與工具解析,透過基於 SWIM 協議的高可用性網格網路實現多節點擴展。
Who it’s for
此方案適合在大規模部署 LLM 的工程師與組織,需要高效能、企業級的流量平衡、工作者生命週期管理,以及對隱私與歷史儲存的嚴格控制。
Highlights
- Cache-Aware Routing: 透過了解底層推論引擎的 KV 快取狀態,最佳化 GPU 使用率。
- Unified API: 為 OpenAI、Anthropic、Gemini、Bedrock 以及各種自建後端提供單一端點。
- Enterprise-Grade Control: 包含多租戶速率限制、OIDC 認證與 WebAssembly(WASM)插件以支援自訂邏輯。
- High Availability: 具備電路斷路器與自動故障轉移的網格網路架構。
- Pluggable Storage: 支援多種聊天歷史後端,包括 PostgreSQL、Oracle 與 Redis。