lightseekorg/smg

Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.

What it solves

Shepherd Model Gateway (SMG) 简化了大规模 LLM 基础设施的部署,提供集中式路由层。它消除需要为不同模型和供应商管理多个分散端点的需求,同时解决 GPU 利用率不足、流量突增以及混合(云端和自托管)环境缺乏统一可观测性的常见生产挑战。

How it works

SMG 作为一个与引擎无关的网关,位于用户和推理工作者之间。它使用单一统一 API,将请求路由到各种后端——包括自托管引擎如 vLLM、SGLang,或云供应商如 OpenAI、Anthropic。为优化性能,它采用缓存感知路由,复用工作者之间的 KV 缓存前缀,减少冗余计算。系统使用 Rust 构建以实现高性能,并使用 gRPC 管道进行流式传输和工具解析,基于 SWIM 协议的高可用网格网络实现多节点扩展。

Who it’s for

它面向在规模化部署 LLM 的工程师和组织,需要高性能、企业级的流量平衡、工作者生命周期管理,以及对隐私和历史存储的严格控制。

Highlights

  • Cache-Aware Routing: 通过了解底层推理引擎的 KV 缓存状态,优化 GPU 利用率。
  • Unified API: 为 OpenAI、Anthropic、Gemini、Bedrock 以及各种自托管后端提供单一端点。
  • Enterprise-Grade Control: 包含多租户限流、OIDC 认证和 WebAssembly(WASM)插件以实现自定义逻辑。
  • High Availability: 具备电路断路器和自动故障转移的网格网络架构。
  • Pluggable Storage: 支持多种聊天历史后端,包括 PostgreSQL、Oracle 和 Redis。