smg-project/smg
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
它解决了什么问题
SMG (Shepherd Model Gateway) 解决了管理大规模 LLM 部署的复杂性。它消除了开发者为不同模型引擎或云提供者管理多个分散端点的需求,同时优化 GPU 利用率,并提供企业级别的流量、安全与可观测性控制。
它是如何工作的
SMG 作为一个高性能且与引擎无关的路由网关工作。它为客户端提供单一统一端点,然后将请求路由到各种后端——包括自托管引擎(如 vLLM、SGLang 和 TensorRT-LLM)以及云提供者(OpenAI、Anthropic、Gemini)。它使用原生 Rust 和流式 gRPC 管道来最小化延迟。为了最大化效率,它采用了缓存感知路由,在基数树中追踪 KV-cache 状态,以在工作节点间重用前缀。
它适合谁使用
它专为需要在混合环境(云与自托管)间平衡流量、实施严格的多租户与优先调度,并且保持对其推理基础设施完整可观测性的大规模 LLM 部署组织而设计。
特点
- 统一 API:支持 OpenAI、Anthropic、Gemini 和 xAI,以及任何 OpenAI 兼容端点。
- 缓存感知路由:追踪 KV-cache 状态以在多个工作节点间优化 GPU 利用率。
- 企业控制:包含优先准入调度、OIDC 认证以及可插拔的聊天记录存储。
- C 级性能:以 Rust 构建,具备零拷贝缓存命中与预填/解码分离。
- 可扩展性:支持 WebAssembly (WASM) 插件以实现自定义逻辑,并支持 Model Context Protocol (MCP) 集成以执行工具。
- 可观测性:提供超过 90 个 Prometheus 指标与 OpenTelemetry 追踪。
相关
- 项目
- 项目
- 项目
- 项目