runpod-workers/worker-vllm
The Runpod worker template for serving our large language model endpoints. Powered by vLLM.
What it solves
Runpod Serverless에서 고성능 대규모 언어 모델(LLM) 엔드포인트 배포를 간소화합니다. 서버리스 환경에 맞게 vLLM 추론 엔진을 수동으로 설정할 필요가 없으며, OpenAI API와 완전히 호환되는 즉시 사용 가능한 워커를 제공합니다.
How it works
이 프로젝트는 vLLM 추론 엔진을 래핑한 Docker 기반 워커를 제공합니다. 사용자는 두 가지 방법으로 배포할 수 있습니다: 사전 구축된 이미지를 사용하고 MODEL_NAME 및 QUANTIZATION과 같은 환경 변수를 통해 모델을 설정하거나, 모델 가중치를 포함한 커스텀 Docker 이미지를 빌드하여 시작 속도를 높이는 방법입니다. 다양한 vLLM 엔진 인자를 환경 변수로 전달할 수 있으며, config.yaml 파일을 통해서도 설정이 가능합니다. 배포가 완료되면 OpenAI 호환 API를 노출하여 기존 OpenAI 베이스 URL과 API 키를 Runpod 엔드포인트로 교체하기만 하면 됩니다.
Who it’s for
서버리스 인프라에서 최소 설정으로 자체 오픈소스 LLM을 호스팅하고 싶으며, 기존 OpenAI 기반 코드와 완전한 호환성을 필요로 하는 개발자 및 AI 엔지니어를 위한 솔루션입니다.
Highlights
- OpenAI Compatibility: Chat Completions, Models, Responses, Messages 라우트를 지원하며 스트리밍 및 비스트리밍 옵션을 모두 제공합니다.
- Flexible Deployment: 빠른 설정을 위한 사전 구축 이미지와 로드 시간을 최적화한 "베이크인" 모델 이미지를 모두 제공합니다.
- Deep vLLM Integration: 환경 변수에서
AsyncEngineArgs를 자동으로 감지하고 적용하여 vLLM의 모든 설정 옵션에 완전 접근을 가능하게 합니다. - Broad Model Support: Hugging Face에서 vLLM 엔진이 지원하는 모든 모델 아키텍처와 호환됩니다.