InftyAI/llmaz

☸️ Easy, advanced inference platform for large language models on Kubernetes. 🌟 Star to support our work!

解決的問題

llmaz 是一個為 Kubernetes 設計的生產就緒型推理平台,旨在簡化大型語言模型(LLMs)的部署與管理。它消除了手動配置基礎設施、模型載入與擴展的複雜性,從而實現高性能量產 AI 服務的快速交付。

工作原理

llmaz 作為 Kubernetes 上的編排層,與多種先進的推理後端(如 vLLM、TensorRT-LLM 和 llama.cpp)整合。它能自動從 HuggingFace 和 ModelScope 等供應商載入模型權重,並管理模型服務的生命周期。同時支援分散式推理,並與 AI Gateway 整合以實現流量管理,還支援透過 Karpenter 實現節點自動擴縮容。

適用對象

需要在 Kubernetes 上以最少設定與最低整體基礎設施開銷將 LLM 部署至生產環境的雲端工程師、MLOps 工程師與開發者。

核心亮點

  • 廣泛的後端支援:相容 vLLM、Text-Generation-Inference、SGLang、llama.cpp 與 TensorRT-LLM。
  • 自動模型載入:自動處理來自 HuggingFace、ModelScope 與物件儲存的模型權重。
  • 異構叢集支援:透過 InftyAI 排程器,可在不同類型的裝置上提供模型服務。
  • 高效擴展能力:支援基於 LLM 指標進行水平 Pod 擴縮容,並透過 Karpenter 實現節點自動擴縮容。
  • 整合 AI 網關:透過 Envoy AI 網關提供基於權杖的速率限制與模型路由功能。
  • 內建 ChatUI:與 Open WebUI 整合,開箱即用支援 RAG 與函數呼叫的聊天機器人功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案