ServerlessLLM/ServerlessLLM
Serverless LLM Serving for Everyone.
解決的問題
ServerlessLLM 解決了在共享 GPU 資源上部署多個大型語言模型(LLM)所面臨的高成本與高延遲問題。它消除了通常阻礙『無伺服器』AI 部署的緩慢模型載入時間,讓多個模型能快速在 GPU 記憶體中切換。
工作原理
該系統採用三項核心技術創新:
- 快速檢查點載入:使用自訂二進位儲存格式與
O_DIRECTI/O 來繞過作業系統頁面快取,結合固定記憶體池實現 DMA 加速傳輸至 GPU。這使得模型載入速度比標準 SafeTensors 快 6-10 倍。 - GPU 多路複用:實現儲存感知排程與快速切換,使單一 GPU 可服務多個不同模型,並可在閒置時將實例縮放至零。
- 統一流程:整合推論與 LoRA 微調,支援單一基礎模型搭配數百個專用 LoRA 適配器的高效服務。
適用對象
適用於需要在有限 GPU 硬體上托管多個 AI 模型的開發者與基礎設施工程師,構建無伺服器 AI 平台的團隊,或需要為眾多使用者/任務提供即時微調與推論的團隊。
主要亮點
- 極快載入速度:比 SafeTensors 快 6-10 倍載入模型。
- 高密度:單一 GPU 可支援 10+ 個模型服務。
- 廣泛相容性:相容 vLLM、Transformers,並支援 NVIDIA 與 AMD GPU。
- 生產就緒:提供 OpenAI 相容 API,支援 Docker、Kubernetes 與多節點叢集。
- 支援 RAG:可透過專用嵌入端點部署嵌入模型與 LLM 一同使用。
相關
- 專案
- 專案
- 專案
- 專案