smg-project/smg
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
它解決了什麼問題
SMG (Shepherd Model Gateway) 解決了管理大規模 LLM 部署的複雜性。它消除了開發者為不同模型引擎或雲端提供者管理多個分散端點的需求,同時優化 GPU 利用率,並提供企業級別的流量、安全與可觀測性控制。
它是如何運作的
SMG 作為一個高效能且與引擎無關的路由閘道運作。它為客戶端提供單一統一端點,然後將請求路由到各種後端——包括自託管引擎(如 vLLM、SGLang 和 TensorRT-LLM)以及雲端提供者(OpenAI、Anthropic、Gemini)。它使用原生 Rust 和串流 gRPC 管線來最小化延遲。為了最大化效率,它採用了快取感知路由,在基數樹中追蹤 KV-cache 狀態,以在工作節點間重用前綴。
它適合誰使用
它專為需要在混合環境(雲端與自託管)間平衡流量、實施嚴格的多租戶與優先排程,並且保持對其推論基礎設施完整可觀測性的大規模 LLM 部署組織而設計。
特色
- 統一 API:支援 OpenAI、Anthropic、Gemini 和 xAI,以及任何 OpenAI 相容端點。
- 快取感知路由:追蹤 KV-cache 狀態以在多個工作節點間優化 GPU 利用率。
- 企業控制:包含優先准入排程、OIDC 認證以及可插拔的聊天記錄儲存。
- C 級效能:以 Rust 建構,具備零拷貝快取命中與預填/解碼分離。
- 擴展性:支援 WebAssembly (WASM) 外掛程式以實現自訂邏輯,並支援 Model Context Protocol (MCP) 整合以執行工具。
- 可觀測性:提供超過 90 個 Prometheus 指標與 OpenTelemetry 追蹤。
相關
- 專案
- 專案
- 專案
- 專案