vllm-project/aibrix

Cost-efficient and pluggable Infrastructure components for GenAI inference

解決的問題

AIBrix 為構建可擴展的企業級 GenAI 推理基礎設施提供了構建模組。它解決了在雲原生環境中部署、管理與擴展大型語言模型 (LLM) 推理的挑戰,特別專注於成本效益與資源優化。

工作原理

AIBrix 作為 LLM 推理(例如 vLLM)的 Kubernetes 原生控制平面運作。它利用雲原生架構來管理模型及其副本的生命週期。關鍵組件包括用於智慧路由的 LLM Gateway、用於動態資源調整的應用程式定制化自動擴縮器,以及用於指標標準化與模型管理的統一 AI 執行階段 sidecar。

適用對象

專為需要在多個節點與異構 GPU 硬體上部署大規模 LLM 推理工作負載,同時維持服務層級目標 (SLO) 的企業與系統研究人員設計。

亮點

  • LLM 感知路由:透過專用閘道高效地在多個模型與副本之間導流。
  • 高成本效益的異構服務:支援混合 GPU 推理以降低營運成本。
  • 高密度 LoRA 管理:對模型的輕量級低秩自適應提供簡化支援。
  • 分散式 KV 快取:實現不同推理引擎之間的高容量 KV 重用。
  • 資源管理:包含應用程式定制化自動擴縮器與主動的 GPU 硬體故障檢測。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案