vllm-project/semantic-router

A programmable Mixture-of-Models router for heterogeneous LLM inference

해결하는 문제

vLLM Semantic Router는 분산된 LLM 인프라의 문제를 해결하기 위해 설계되었습니다. 애플리케이션에 루팅 로직을 하드코딩하는 대신, 개발자가 "모델 혼합(Mixture-of-Models)" 시스템을 관리할 수 있는 프로그래머블 레이어를 제공합니다. 특정 신호와 정책에 따라 각 요청에 적합한 모델 경로를 선택함으로써 품질, 비용, 지연 시간, 프라이버시를 최적화할 수 있습니다.

작동 방식

이 시스템은 요청 신호, 사용자 선호, 애플리케이션 정책을 평가하여 모델 경로를 선택하거나 조합하는 라우팅 레이어로 작동합니다. GPU, 가속기, 엣지 디바이스, 클라우드 인프라 등 다양한 컴퓨팅 환경 간에 요청을 라우팅할 수 있으며, 데이터 경계를 유지하여 프라이버시를 보장합니다.

대상 사용자

다양한 하드웨어와 위치(엣지, 사설, 클라우드)에서 여러 모델을 사용하는 복잡한 LLM 애플리케이션을 개발하는 개발자 및 조직을 위한 것입니다. 요청이 어떻게 해당 모델로 라우팅되는지를 프로그래머블하게 관리하고 싶은 분들에게 적합합니다.

주요 특징

  • 프로그래머블 라우팅: 모델 선택을 정책을 통해 실행 가능하게 하여 하드코딩된 로직을 피합니다.
  • 이종 컴퓨팅 지원: GPU, 가속기, 엣지, 클라우드의 혼합 환경을 라우팅할 수 있습니다.
  • 모델 혼합: 다양한 워크로드에 맞춰 개인화된 모델 경로를 조합할 수 있습니다.
  • 프라이버시 인식: 라우팅 과정 중 데이터를 특정 경계 내에 유지할 수 있습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch