InftyAI/llmaz

☸️ Easy, advanced inference platform for large language models on Kubernetes. 🌟 Star to support our work!

解决的问题

llmaz 是一个为 Kubernetes 设计的生产就绪型推理平台,旨在简化大规模语言模型(LLMs)的部署和管理。它消除了手动配置基础设施、模型加载和扩展的复杂性,从而实现高性能 AI 服务的快速交付。

工作原理

llmaz 作为 Kubernetes 上的编排层,与多种先进的推理后端(如 vLLM、TensorRT-LLM 和 llama.cpp)集成。它能自动从 HuggingFace 和 ModelScope 等提供商加载模型权重,并管理模型服务的生命周期。同时支持分布式推理,并与 AI Gateway 集成以实现流量管理,还支持通过 Karpenter 实现节点自动扩缩容。

适用人群

需要在 Kubernetes 上以最少配置和最低整体基础设施开销将 LLM 部署到生产环境的云工程师、MLOps 工程师和开发者。

核心亮点

  • 广泛的后端支持:兼容 vLLM、Text-Generation-Inference、SGLang、llama.cpp 和 TensorRT-LLM。
  • 自动模型加载:自动处理来自 HuggingFace、ModelScope 和对象存储的模型权重。
  • 异构集群支持:通过 InftyAI 调度器,可在不同类型的设备上提供模型服务。
  • 高效扩展能力:支持基于 LLM 指标进行水平 Pod 扩缩容,并通过 Karpenter 实现节点自动扩缩容。
  • 集成 AI 网关:通过 Envoy AI 网关提供基于令牌的速率限制和模型路由功能。
  • 内置 ChatUI:与 Open WebUI 集成,开箱即用支持 RAG 和函数调用的聊天机器人功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目