sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

What it solves

SGLang은 대형 언어 모델(LLMs) 및 멀티모달 모델의 저지연·고처리량 추론 문제를 해결하기 위해 설계된 고성능 서빙 프레임워크입니다. 단일 GPU부터 대규모 분산 클러스터까지 다양한 환경에서 효율적인 배포가 가능합니다.

How it works

SGLang은 빠른 런타임과 여러 고급 최적화 기술을 결합하여 성능을 극대화합니다:

  • Prefix Caching: RadixAttention을 사용해 프롬프트 프리픽스를 효율적으로 관리하고 재사용합니다.
  • Scheduling and Batching: 제로 오버헤드 CPU 스케줄러와 연속 배치를 활용해 요청 처리를 최적화합니다.
  • Parallelism: 텐서, 파이프라인, 전문가, 데이터 병렬을 지원해 분산 워크로드에 대응합니다.
  • Memory Management: 페이지드 어텐션과 청크 프리필을 구현합니다.
  • Decoding Optimizations: 추측 디코딩과 구조화된 출력을 포함해 생성 속도를 높입니다.
  • Quantization: FP4, FP8, INT4, AWQ, GPTQ 등 다양한 포맷을 지원해 메모리 사용량을 줄입니다.

Who it’s for

  • AI Engineers and Developers: 최대 효율과 최소 지연 시간으로 LLM 및 멀티모달 모델을 배포하고자 하는 엔지니어 및 개발자.
  • MLOps Professionals: NVIDIA, AMD, Intel, Google TPU, Ascend NPU 등 다양한 하드웨어를 지원하는 견고하고 확장 가능한 서빙 인프라가 필요한 사용자.
  • Researchers: RL 및 사후 학습 프레임워크의 백엔드로 SGLang을 활용하는 연구자.

Highlights

  • Broad Model Support: Llama, Qwen, DeepSeek, Mistral 등 주요 오픈 모델은 물론 임베딩, 보상, 확산 모델도 호환됩니다.
  • Extensive Hardware Support: 최신 NVIDIA GB200/B300 GPU와 AMD Instinct MI300 시리즈 등 다양한 하드웨어에서 실행됩니다.
  • Industry Adoption: 전 세계 40만 대 이상의 GPU에서 매일 수조 개의 토큰을 처리합니다.
  • OpenAI API Compatibility: 대부분의 Hugging Face 모델 및 OpenAI API와 호환되어 손쉽게 통합할 수 있습니다.