ServerlessLLM/ServerlessLLM

Serverless LLM Serving for Everyone.

解决的问题

ServerlessLLM 解决了在共享 GPU 资源上部署多个大语言模型(LLM)所面临的高成本和高延迟问题。它消除了通常阻碍‘无服务器’AI 部署的缓慢模型加载时间,使多个模型能够快速在 GPU 内存中切换。

工作原理

该系统采用三项核心技术创新:

  1. 快速检查点加载:使用自定义二进制存储格式和 O_DIRECT I/O 来绕过操作系统页面缓存,结合固定内存池实现 DMA 加速传输至 GPU。这使得模型加载速度比标准 SafeTensors 快 6-10 倍。
  2. GPU 多路复用:实现基于存储感知的调度和快速切换,使单个 GPU 可以服务多个不同模型,包括在空闲时将实例缩放至零。
  3. 统一流水线:将推理与 LoRA 微调集成,支持单个基础模型搭配数百个专用 LoRA 适配器的高效服务。

适用人群

适用于需要在有限 GPU 硬件上托管多个 AI 模型的开发者和基础设施工程师,构建无服务器 AI 平台的团队,或需要为众多用户/任务提供按需微调和推理的团队。

主要亮点

  • 极快加载速度:比 SafeTensors 快 6-10 倍加载模型。
  • 高密度:单个 GPU 可支持 10+ 个模型服务。
  • 广泛兼容性:兼容 vLLM、Transformers,并支持 NVIDIA 和 AMD GPU。
  • 生产就绪:提供 OpenAI 兼容 API,支持 Docker、Kubernetes 和多节点集群。
  • 支持 RAG:可通过专用嵌入端点部署嵌入模型与 LLM 一同使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目