smg-project/smg

Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.

무엇을 해결하는가

SMG (Shepherd Model Gateway)는 대규모 LLM 배포 관리의 복잡성을 해결합니다. 서로 다른 모델 엔진이나 클라우드 제공자를 위한 여러 분산 엔드포인트를 관리해야 하는 개발자의 필요를 없애면서 동시에 GPU 활용률을 최적화하고 트래픽, 보안, 관찰 가능성에 대한 엔터프라이즈급 제어를 제공합니다.

어떻게 작동하는가

SMG는 엔진에 구애받지 않는 고성능 라우팅 게이트웨이로 작동합니다. 클라이언트에게 단일 통합 엔드포인트를 제공한 후, 요청을 다양한 백엔드—자체 호스팅 엔진(vLLM, SGLang, TensorRT-LLM 포함) 및 클라우드 제공자(OpenAI, Anthropic, Gemini)—로 라우팅합니다. 네이티브 Rust와 스트리밍 gRPC 파이프라인을 사용하여 지연 시간을 최소화합니다. 효율을 극대화하기 위해, 라디스 트리에서 KV-cache 상태를 추적하여 워커 간에 프리픽스를 재사용하는 캐시 인식 라우팅을 사용합니다.

누구를 위한 것인가

스케일로 LLM을 배포하는 조직으로, 하이브리드 환경(클라우드 및 자체 호스팅) 간에 트래픽의 균형을 맞추고, 엄격한 멀티테넌시 및 우선순위 스케줄링을 구현하며, 추론 인프라에 대한 완전한 관찰 가능성을 유지해야 하는 조직을 위해 설계되었습니다.

주요 기능

  • 통합 API: OpenAI, Anthropic, Gemini, xAI를 지원하며, 또한 어떤 OpenAI 호환 엔드포인트도 지원합니다.
  • 캐시 인식 라우팅: 여러 워커 간에 GPU 활용률을 최적화하기 위해 KV-cache 상태를 추적합니다.
  • 엔터프라이즈 제어: 우선순위 입장 스케줄링, OIDC 인증, 플러그 가능한 채팅 기록 저장을 포함합니다.
  • C 수준 성능: Rust로 구축되어 제로 복사 캐시 히트 및 프리필/디코드 분리를 제공합니다.
  • 확장성: 사용자 정의 로직을 위한 WebAssembly(WASM) 플러그인과 도구 실행을 위한 Model Context Protocol(MCP) 통합을 지원합니다.
  • 관찰 가능성: 90개 이상의 Prometheus 메트릭과 OpenTelemetry 트레이싱을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트