InternLM/lmdeploy
LMDeploy is a toolkit for compressing, deploying, and serving LLMs.
해결하는 문제
LMDeploy는 대규모 언어 모델(LLM) 및 시각 언어 모델(VLM)의 압축, 배포, 서비스를 간소화하고 가속화하기 위한 툴킷입니다. LLM 추론의 높은 계산 비용과 지연 문제를 해결하기 위해 고성능 엔진과 양자화 기술을 제공합니다.
작동 방식
이 프로젝트는 두 가지 서로 다른 추론 엔진을 제공합니다:
- TurboMind: 최적의 성능 최적화에 초점을 맞추며, 지속적 배치(연속 배치), 블록화된 KV 캐시, 텐서 병렬 처리, 고성능 CUDA 커널 등을 활용합니다.
- PyTorch Engine: Python 기반 엔진으로 개발자의 진입 장벽을 낮추고 새로운 기능에 대한 빠른 실험을 가능하게 합니다.
또한 AWQ 및 KV 캐시 양자화와 같은 양자화 기법을 포함하여 모델 크기와 메모리 사용량을 줄이고, 여러 머신과 GPU에 걸쳐 다중 모델 배포를 관리하는 요청 분배 서비스도 제공합니다.
대상 사용자
- ML 엔지니어 및 DevOps: 고스루풋과 낮은 지연을 요구하는 프로덕션 환경에서 LLM/VLM을 배포하고자 하는 사람.
- AI 연구자: 새로운 모델 아키텍처에 대한 빠른 실험을 원하는 개발자.
- 기업 사용자: 여러 GPU와 머신에 걸쳐 LLM 서비스를 확장하고자 하는 조직.
주요 특징
- 고스루풋: 특정 시나리오에서 vLLM보다 최대 1.8배 높은 요청 처리 속도를 제공.
- 광범위한 모델 지원: Llama, Qwen, InternLM, DeepSeek, Mistral, Phi 등 다양한 모델과 호환.
- 다중 모달 기능: InternVL 및 LLaVA를 포함한 시각 언어 모델(VLM)을 완전히 지원.
- 효율적인 양자화: 4비트 가중치 전용 및 KV 양자화를 지원하여 FP16 대비 추론 속도를 크게 향상.
- 유연한 배포: 다중 모델, 다중 머신, 다중 카드 추론 서비스를 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트