lightseekorg/smg

Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.

What it solves

Shepherd Model Gateway (SMG)는 대규모 LLM 인프라 배포를 단순화하고 중앙 집중식 라우팅 레이어를 제공합니다. 모델 및 공급자별로 분산된 엔드포인트를 관리할 필요가 없으며, GPU 활용도 저하, 트래픽 급증, 하이브리드(클라우드 및 셀프 호스팅) 환경에서의 통합 관측성 부족과 같은 일반적인 운영 문제를 해결합니다.

How it works

SMG는 엔진에 구애받지 않는 게이트웨이로, 사용자와 추론 워커 사이에 위치합니다. 단일 통합 API를 사용해 vLLM, SGLang 같은 셀프 호스팅 엔진이나 OpenAI, Anthropic 같은 클라우드 공급자를 포함한 다양한 백엔드로 요청을 라우팅합니다. 성능 최적화를 위해 캐시 인식 라우팅을 적용해 워커 간 KV 캐시 프리픽스를 재사용함으로써 중복 연산을 줄입니다. 시스템은 Rust로 구현되어 높은 성능을 제공하고, gRPC 파이프라인을 통해 스트리밍 및 도구 파싱을 수행하며, SWIM 프로토콜 기반의 고가용성 메쉬 네트워크로 다중 노드 확장을 지원합니다.

Who it’s for

대규모 LLM을 배포하는 엔지니어와 조직을 위해 설계되었으며, 고성능·엔터프라이즈 수준의 트래픽 밸런싱, 워커 수명 주기 관리, 프라이버시 및 히스토리 저장에 대한 엄격한 제어가 필요한 경우에 적합합니다.

Highlights

  • Cache-Aware Routing: 기본 추론 엔진의 KV 캐시 상태를 파악해 GPU 활용도를 최적화합니다.
  • Unified API: OpenAI, Anthropic, Gemini, Bedrock 및 다양한 셀프 호스팅 백엔드에 대해 단일 엔드포인트를 제공합니다.
  • Enterprise-Grade Control: 멀티 테넌트 속도 제한, OIDC 인증, 맞춤 로직을 위한 WebAssembly(WASM) 플러그인을 포함합니다.
  • High Availability: 회로 차단기와 자동 페일오버 기능을 갖춘 메쉬 네트워킹 아키텍처입니다.
  • Pluggable Storage: PostgreSQL, Oracle, Redis 등 여러 채팅 히스토리 백엔드를 지원합니다.