ServerlessLLM/ServerlessLLM

Serverless LLM Serving for Everyone.

解決的問題

ServerlessLLM 解決了在共享 GPU 資源上部署多個大型語言模型(LLM)所面臨的高成本與高延遲問題。它消除了通常阻礙『無伺服器』AI 部署的緩慢模型載入時間,讓多個模型能快速在 GPU 記憶體中切換。

工作原理

該系統採用三項核心技術創新:

  1. 快速檢查點載入:使用自訂二進位儲存格式與 O_DIRECT I/O 來繞過作業系統頁面快取,結合固定記憶體池實現 DMA 加速傳輸至 GPU。這使得模型載入速度比標準 SafeTensors 快 6-10 倍。
  2. GPU 多路複用:實現儲存感知排程與快速切換,使單一 GPU 可服務多個不同模型,並可在閒置時將實例縮放至零。
  3. 統一流程:整合推論與 LoRA 微調,支援單一基礎模型搭配數百個專用 LoRA 適配器的高效服務。

適用對象

適用於需要在有限 GPU 硬體上托管多個 AI 模型的開發者與基礎設施工程師,構建無伺服器 AI 平台的團隊,或需要為眾多使用者/任務提供即時微調與推論的團隊。

主要亮點

  • 極快載入速度:比 SafeTensors 快 6-10 倍載入模型。
  • 高密度:單一 GPU 可支援 10+ 個模型服務。
  • 廣泛相容性:相容 vLLM、Transformers,並支援 NVIDIA 與 AMD GPU。
  • 生產就緒:提供 OpenAI 相容 API,支援 Docker、Kubernetes 與多節點叢集。
  • 支援 RAG:可透過專用嵌入端點部署嵌入模型與 LLM 一同使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案