runpod-workers/worker-vllm
The Runpod worker template for serving our large language model endpoints. Powered by vLLM.
What it solves
它簡化了在 Runpod Serverless 上部署高效能大型語言模型(LLM)端點的流程。它消除了在無伺服器環境中手動配置 vLLM 推理引擎的需求,提供一個即插即用、完全兼容 OpenAI API 的工作者。
How it works
此專案提供一個基於 Docker 的工作者,將 vLLM 推理引擎封裝起來。使用者可以透過兩種方式部署:使用預建映像並透過環境變數(如 MODEL_NAME、QUANTIZATION)設定模型,或自行建構包含模型權重的自訂 Docker 映像以加速啟動。它支援透過環境變數傳入各種 vLLM 引擎參數,亦可透過 config.yaml 檔案進行設定。部署完成後,會暴露一個兼容 OpenAI 的 API,使用者只需將原本的 OpenAI 基礎 URL 與 API 金鑰換成 Runpod 端點即可。
Who it’s for
開發者與 AI 工程師,想要在無伺服器基礎設施上以最小設定自行託管開源 LLM,且需與現有的 OpenAI 代碼庫完全相容。
Highlights
- OpenAI Compatibility:支援 Chat Completions、Models、Responses 與 Messages 路由,並提供串流與非串流兩種選項。
- Flexible Deployment:提供快速上手的預建映像,以及為優化載入速度而「內建」模型的映像。
- Deep vLLM Integration:自動從環境變數偵測並套用
AsyncEngineArgs,完整開放 vLLM 的所有設定選項。 - Broad Model Support:相容於 Hugging Face 上任何 vLLM 引擎支援的模型架構。