InftyAI/llmaz
☸️ Easy, advanced inference platform for large language models on Kubernetes. 🌟 Star to support our work!
해결하는 문제
llmaz는 Kubernetes에서 대규모 언어 모델(LLM)의 배포 및 관리를 간소화하기 위해 설계된 프로덕션 준비 완료된 추론 플랫폼입니다. 수동으로 인프라를 구성하고, 모델을 로드하며, 성능을 확장하는 복잡성을 제거하여 고성능 AI 서비스를 제공합니다.
작동 방식
llmaz는 vLLM, TensorRT-LLM, llama.cpp와 같은 최신 추론 백엔드와 통합되는 Kubernetes 위의 오케스트레이션 계층입니다. HuggingFace와 ModelScope 같은 공급자로부터 모델 가중치를 자동으로 로드하고 모델 서비스의 라이프사이클을 관리합니다. 또한 분산 추론을 지원하며, 트래픽 관리와 Karpenter를 통한 노드 자동 확장과 같은 확장 도구와 AI 게이트웨이와 통합됩니다.
대상 사용자
Kubernetes에서 LLM을 최소한의 구성과 전반적인 인프라 부담으로 프로덕션 환경에 배포해야 하는 클라우드 엔지니어, MLOps 엔지니어, 개발자에게 적합합니다.
주요 특징
- 광범위한 백엔드 지원: vLLM, Text-Generation-Inference, SGLang, llama.cpp, TensorRT-LLM과 호환됩니다.
- 자동 모델 로드: HuggingFace, ModelScope, ObjectStores에서 모델 가중치를 자동으로 처리합니다.
- 이종 클러스터 지원: InftyAI 스케줄러를 사용하여 다양한 유형의 장치에서 모델을 제공할 수 있습니다.
- 확장 효율성: LLM 메트릭 기반 수평 포드 스케일링과 Karpenter를 통한 노드 자동 확장 지원.
- 통합된 AI 게이트웨이: Envoy AI 게이트웨이를 통해 토큰 기반의 레이트 제한과 모델 라우팅을 제공합니다.
- 내장형 챗UI: Open WebUI와 통합되어 RAG 및 함수 호출을 포함한 즉시 사용 가능한 챗봇 기능을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트