ServerlessLLM/ServerlessLLM
Serverless LLM Serving for Everyone.
解决的问题
ServerlessLLM 解决了在共享 GPU 资源上部署多个大语言模型(LLM)所面临的高成本和高延迟问题。它消除了通常阻碍‘无服务器’AI 部署的缓慢模型加载时间,使多个模型能够快速在 GPU 内存中切换。
工作原理
该系统采用三项核心技术创新:
- 快速检查点加载:使用自定义二进制存储格式和
O_DIRECTI/O 来绕过操作系统页面缓存,结合固定内存池实现 DMA 加速传输至 GPU。这使得模型加载速度比标准 SafeTensors 快 6-10 倍。 - GPU 多路复用:实现基于存储感知的调度和快速切换,使单个 GPU 可以服务多个不同模型,包括在空闲时将实例缩放至零。
- 统一流水线:将推理与 LoRA 微调集成,支持单个基础模型搭配数百个专用 LoRA 适配器的高效服务。
适用人群
适用于需要在有限 GPU 硬件上托管多个 AI 模型的开发者和基础设施工程师,构建无服务器 AI 平台的团队,或需要为众多用户/任务提供按需微调和推理的团队。
主要亮点
- 极快加载速度:比 SafeTensors 快 6-10 倍加载模型。
- 高密度:单个 GPU 可支持 10+ 个模型服务。
- 广泛兼容性:兼容 vLLM、Transformers,并支持 NVIDIA 和 AMD GPU。
- 生产就绪:提供 OpenAI 兼容 API,支持 Docker、Kubernetes 和多节点集群。
- 支持 RAG:可通过专用嵌入端点部署嵌入模型与 LLM 一同使用。
相关
- 项目
- 项目
- 项目
- 项目