triton-inference-server/tensorrtllm_backend
The Triton TensorRT-LLM Backend
해결하는 문제
이 프로젝트는 TensorRT-LLM로 최적화된 대규모 언어 모델(LLM)을 배포할 수 있도록 Triton Inference Server용 백엔드를 제공합니다. 고성능 LLM 추론 배포를 간소화하며, 비행 중 배치 처리 및 페이지화된 어텐션과 같은 고급 기능을 지원하여 NVIDIA GPU에서 처리량과 효율성을 극대화합니다.
작동 방식
이 백엔드는 TensorRT-LLM을 Triton Inference Server 생태계에 통합합니다. 다음과 같은 방식으로 배포할 수 있습니다:
- PyTorch 백엔드 (LLM API): 수동 엔진 컴파일 없이 HuggingFace 모델을 직접 배포할 수 있습니다.
- 배포 모드: "리더 모드" (GPU당 하나의 Triton 프로세스, Slurm에 적합)와 "오케스트레이터 모드" (하나의 오케스트레이터 프로세스가 GPU당 워커를 생성)를 지원합니다.
- 병렬 처리: 대규모 모델을 여러 GPU 또는 노드에 분산하기 위해 텐서, 파이프라인, 전문가 병렬 처리를 구현합니다.
- 실행: 비행 중 배치 처리 및 요청 스케줄링을 처리하기 위해 C++로 구현된 커널 배치 매니저를 사용합니다.
대상 사용자
NVIDIA 하드웨어를 사용하여 LLM을 프로덕션 환경에 배포해야 하는 머신러닝 엔지니어 및 DevOps 전문가를 대상으로 설계되었습니다. 특히 고처리량, 다중 GPU 스케일링, Triton Inference Server와의 통합이 필요한 사용자에게 적합합니다.
주요 특징
- 고급 배치 처리: 비행 중 배치 처리 및 페이지화된 어텐션을 지원합니다.
- 유연한 배포: 멀티노드 지원 및 Slurm 기반 클러스터와의 호환성.
- 다양한 디코딩: Top-k, Top-p, 비임계 검색, 그리고 추측적 디코딩 (Medusa, ReDrafter, Lookahead, Eagle)을 지원합니다.
- 모델 지원: LLaMA, Gemma, Mistral 및 다양한 멀티모달 및 인코더-디코더 모델과 호환됩니다.
- 최적화: 양자화 및 LoRA와의 통합을 통해 성능과 메모리 효율성을 향상시킵니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch