runpod-workers/worker-vllm
The Runpod worker template for serving our large language model endpoints. Powered by vLLM.
What it solves
它简化了在 Runpod Serverless 上部署高性能大型语言模型(LLM)端点的流程。它消除了在无服务器环境中手动配置 vLLM 推理引擎的需求,提供一个即插即用、完全兼容 OpenAI API 的工作者。
How it works
此项目提供一个基于 Docker 的工作者,将 vLLM 推理引擎封装起来。用户可以通过两种方式部署:使用预构建镜像并通过环境变量(如 MODEL_NAME、QUANTIZATION)配置模型,或自行构建包含模型权重的自定义 Docker 镜像以加快启动速度。它支持通过环境变量传入各种 vLLM 引擎参数,也可以通过 config.yaml 文件进行配置。部署完成后,会暴露一个兼容 OpenAI 的 API,用户只需将原来的 OpenAI 基础 URL 与 API 密钥替换为 Runpod 端点即可。
Who it’s for
开发者和 AI 工程师,想要在无服务器基础设施上以最小设置自行托管开源 LLM,并且需要与现有的 OpenAI 代码库完全兼容。
Highlights
- OpenAI Compatibility:支持 Chat Completions、Models、Responses 与 Messages 路由,提供流式和非流式两种选项。
- Flexible Deployment:提供快速上手的预构建镜像,以及为优化加载速度而“内置”模型的镜像。
- Deep vLLM Integration:自动从环境变量发现并应用
AsyncEngineArgs,完整开放 vLLM 的所有配置选项。 - Broad Model Support:兼容 Hugging Face 上任何 vLLM 引擎支持的模型架构。