vllm-project/aibrix
Cost-efficient and pluggable Infrastructure components for GenAI inference
解决的问题
AIBrix 为构建可扩展的企业级 GenAI 推理基础设施提供了构建块。它解决了在云原生环境中部署、管理和扩展大语言模型 (LLM) 推理的挑战,特别专注于成本效益和资源优化。
工作原理
AIBrix 作为 LLM 推理(例如 vLLM)的 Kubernetes 原生控制平面运行。它利用云原生架构来管理模型及其副本的生命周期。关键组件包括用于智能路由的 LLM Gateway、用于动态资源调整的定制化应用自动扩缩器,以及用于指标标准化和模型管理的统一 AI 运行时 sidecar。
适用对象
专为需要跨多个节点和异构 GPU 硬件部署大规模 LLM 推理工作负载,同时保持服务水平目标 (SLO) 的企业和系统研究人员设计。
亮点
- LLM 感知路由:通过专用网关高效地在多个模型和副本之间分发流量。
- 高成本效益的异构服务:支持混合 GPU 推理以降低运营成本。
- 高密度 LoRA 管理:对模型的轻量级低秩自适应提供简化支持。
- 分布式 KV 缓存:实现不同推理引擎之间的高容量 KV 复用。
- 资源管理:包括定制化应用自动扩缩器和主动的 GPU 硬件故障检测。
相关
- 项目
- 项目
- 项目
- 项目
- 项目