ServerlessLLM/ServerlessLLM

Serverless LLM Serving for Everyone.

해결하는 문제

ServerlessLLM은 공유 GPU 리소스 위에 여러 대규모 언어 모델(LLM)을 배포할 때 발생하는 높은 비용과 지연을 해결합니다. 일반적으로 '서버리스' AI 배포를 방해하는 느린 모델 로딩 시간을 제거하여, 여러 모델을 GPU 메모리 간에 빠르게 교체할 수 있게 합니다.

작동 방식

이 시스템은 세 가지 주요 기술적 혁신을 활용합니다:

  1. 빠른 체크포인트 로딩: 커스텀 바이너리 저장 형식과 O_DIRECT I/O를 사용해 OS 페이지 캐시를 우회하고, 핀된 메모리 풀을 활용해 GPU로의 DMA 가속 전송을 수행합니다. 이로 인해 표준 SafeTensors보다 6~10배 빠르게 모델을 로드할 수 있습니다.
  2. GPU 멀티플렉싱: 스토리지 인식 스케줄링과 빠른 전환 기능을 구현하여 하나의 GPU가 수많은 다른 모델을 제공할 수 있도록 하며, 유휴 시 인스턴스를 0으로 확장할 수 있습니다.
  3. 통합 파이프라인: 추론과 LoRA 미세조정을 통합하여 하나의 기본 모델과 수백 개의 전문화된 LoRA 어댑터를 효율적으로 제공할 수 있습니다.

대상 사용자

제한된 GPU 하드웨어 위에 여러 AI 모델을 호스팅해야 하는 개발자 및 인프라 엔지니어, 서버리스 AI 플랫폼을 구축하는 팀, 또는 다양한 사용자/작업에 대해 온디맨드 미세조정과 추론이 필요한 팀에게 적합합니다.

주요 특징

  • 극도의 빠른 로딩 속도: SafeTensors보다 6~10배 빠르게 모델을 로드합니다.
  • 고밀도: 단일 GPU에서 10개 이상의 모델을 제공할 수 있습니다.
  • 광범위한 호환성: vLLM, Transformers를 지원하며 NVIDIA 및 AMD GPU 모두를 지원합니다.
  • 프로덕션 준비 완료: OpenAI 호환 API를 제공하고 Docker, Kubernetes, 멀티노드 클러스터를 지원합니다.
  • RAG 지원: 전용 임베딩 엔드포인트를 통해 LLM과 함께 임베딩 모델을 배포할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트