AstraNetLab/CacheRoute

CacheRoute is an innovative LLM scheduling scheme dedicated to enabling flexible KV cache reuse across LLM systems, improving task performance and system efficiency.

해결하는 문제

CacheRoute는 여러 LLM 요청이 반복적으로 동일한 긴 외부 지식 텍스트를 사용할 때 발생하는 무거운 프리필 오버헤드와 중복 계산을 줄입니다. 매번 프롬프트를 다시 계산하는 대신, 다른 LLM 시스템 간에 키-값(KV) 캐시를 재사용함으로써 지연을 낮추고 처리량을 높입니다.

작동 방식

vLLM과 LMCache를 기반으로 구축된 CacheRoute는 지식 전달 네트워크(KDN) 아키텍처를 구현합니다. 인기 있는 지식에 대한 KV 캐시 블록을 저장하고 관리하기 위한 전용 KDN 서버를 사용합니다.

요청이 도착하면 다음 워크플로우를 따릅니다:

  1. 스케줄러: 지식 요구사항을 분석하고 가장 효율적인 리소스 풀로 요청을 라우팅합니다.
  2. 프록시: 텍스트 기반 vs. KV 캐시 기반 주입의 비용을 예측하고 실시간 컴퓨팅 및 네트워크 부하에 따라 최적의 전략을 동적으로 선택합니다.
  3. KDN 서버: 재사용 전략이 선택된 경우 사전에 계산된 KV 캐시 블록을 삽입합니다.
  4. 인스턴스: 요청을 vLLM 및 LMCache 백엔드로 전달하여 최종 실행을 수행합니다.

대상 사용자

브라우저 기반 AI 어시스턴트 및 지식 기반 QA 시스템과 같이 동일한 참조 자료를 많은 사용자가 자주 접근하는 지식 집약형 LLM 서비스를 위한 것입니다.

주요 특징

  • 컴퓨팅-네트워크 조율: 현재 시스템 부하에 따라 재계산과 캐시 주입 간에 동적으로 전환합니다.
  • 시스템 간 재사용: KDN 서버를 통해 다른 LLM 시스템 간에 재사용 가능한 지식을 공유합니다.
  • 지식 기반 라우팅: 지식 가용성과 시스템 토폴로지에 따라 요청을 라우팅합니다.
  • 관측성 도구: 프록시용 브라우저 UI와 인스턴스 리소스 대시보드를 포함하여 제어 플레인 상태와 리소스 스냅샷을 모니터링할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트