sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
해결하는 문제
SGLang은 대규모 언어 모델(LLM) 및 멀티모달 모델의 저지연, 고처리량 추론 문제를 해결하기 위해 설계된 고성능 서빙 프레임워크입니다. 단일 GPU부터 대규모 분산 클러스터에 이르기까지 다양한 하드웨어 환경에서 효율적인 배포를 가능하게 합니다.
작동 방식
SGLang은 여러 고급 최적화 기법을 활용한 빠른 런타임을 사용하여 성능을 극대화합니다:
- RadixAttention: 효율적인 프리픽스 캐싱에 사용됩니다.
- 스케줄링 및 배치: 오버헤드 없는 CPU 스케줄러와 지속적 배치를 사용합니다.
- 병렬 처리: 텐서, 파이프라인, 전문가, 데이터 병렬 처리를 지원하여 대규모 워크로드를 처리합니다.
- 메모리 관리: 페이지 기반 어텐션과 청크 기반 프리필을 사용합니다.
- 디코딩 최적화: 사전 추정 디코딩과 구조화된 출력을 구현합니다.
- 양자화: FP4, FP8, INT4, AWQ, GPTQ 등 다양한 형식을 지원합니다.
대상 사용자
대규모 LLM 및 멀티모달 모델을 배포하는 개발자 및 조직, 그리고 RL 및 사후 훈련 프레임워크(AReaL, Miles, verl 등)의 롤아웃 백엔드로 사용하는 연구자에게 적합합니다.
주요 특징
- 광범위한 모델 지원: Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, Mistral은 물론 임베딩, 보상, 확산 모델도 지원합니다.
- 다양한 하드웨어 호환성: NVIDIA GPU, AMD GPU, Intel Xeon CPU, Google TPU, Ascend NPU에서 실행 가능합니다.
- 산업계 채택: 전 세계 40만 개 이상의 GPU를 구동하고 있으며, xAI, NVIDIA, AMD와 같은 주요 기술 기업에서 사용되고 있습니다.
- OpenAI API 호환성: 대부분의 Hugging Face 모델 및 OpenAI API와 호환됩니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트