vllm-project/aibrix

Cost-efficient and pluggable Infrastructure components for GenAI inference

해결하는 문제

AIBrix는 확장 가능한 엔터프라이즈급 GenAI 추론 인프라를 구축하기 위한 구성 요소를 제공합니다. 클라우드 네이티브 환경에서 대규모 언어 모델(LLM) 추론을 배포, 관리 및 확장할 때 발생하는 과제, 특히 비용 효율성 및 리소스 최적화 문제를 해결합니다.

작동 방식

AIBrix는 LLM 추론(vLLM 등)을 위한 Kubernetes 네이티브 컨트롤 플레인 역할을 합니다. 클라우드 네이티브 아키텍처를 활용하여 모델 및 복제본의 라이프사이클을 관리합니다. 주요 구성 요소로는 지능형 라우팅을 위한 LLM Gateway, 동적 리소스 조정을 위한 앱 맞춤형 오토스케일러, 메트릭 표준화 및 모델 관리를 위한 통합 AI 런타임 사이드카가 있습니다.

대상 사용자

서비스 수준 목표(SLO)를 유지하면서 여러 노드와 이기종 GPU 하드웨어에 걸쳐 대규모 LLM 추론 워크로드를 배포해야 하는 기업 및 시스템 연구자를 위해 설계되었습니다.

주요 특징

  • LLM 인식 라우팅: 전용 게이트웨이를 통해 여러 모델과 복제본으로 트래픽을 효율적으로 전달합니다.
  • 비용 효율적인 이기종 서빙: 혼합 GPU 추론을 지원하여 운영 비용을 절감합니다.
  • 고밀도 LoRA 관리: 모델의 경량 저차원 적응(LoRA)을 간소화된 방식으로 지원합니다.
  • 분산 KV 캐시: 서로 다른 추론 엔진 간에 대용량 KV 재사용을 가능하게 합니다.
  • 리소스 관리: 앱 맞춤형 오토스케일러와 선제적인 GPU 하드웨어 장애 탐지를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트