InftyAI/llmaz

☸️ Easy, advanced inference platform for large language models on Kubernetes. 🌟 Star to support our work!

何を解決するか

llmaz は Kubernetes 上で大規模言語モデル(LLM)のデプロイと管理を簡素化する、本番環境対応の推論プラットフォームです。手動でのインフラ構成、モデルの読み込み、スケーリングの複雑さを排除し、高性能なAIサービスの提供を可能にします。

動作方法

llmaz は Kubernetes 上のオーケストレーション層として機能し、vLLM、TensorRT-LLM、llama.cpp などの最先端の推論バックエンドと統合します。HuggingFace や ModelScope などのプロバイダーからモデルウェイトを自動的に読み込み、モデルサービスのライフサイクルを管理します。また、分散推論をサポートし、AI Gateway と統合してトラフィック管理を行い、Karpenter によるノードの自動スケーリングも可能にします。

対象ユーザー

Kubernetes 上で LLM を本番環境にデプロイする必要があるクラウドエンジニア、MLOpsエンジニア、開発者で、最小限の構成と全体的なインフラのオーバーヘッドで運用したい方。

主な特徴

  • 広範なバックエンド対応: vLLM、Text-Generation-Inference、SGLang、llama.cpp、TensorRT-LLM に対応。
  • 自動モデル読み込み: HuggingFace、ModelScope、ObjectStores からのモデルウェイトを自動で処理。
  • 異種クラスタ対応: InftyAI スケジューラを使用して、異なる種類のデバイス間でモデルを配信可能。
  • スケーリング効率: LLM メトリクスに基づく水平ポッドスケーリングと、Karpenter によるノード自動スケーリングをサポート。
  • 統合された AI Gateway: Envoy AI Gateway を通じてトークンベースのレート制限とモデルルーティングを提供。
  • 組み込みチャットUI: Open WebUI と統合し、RAG や関数呼び出しを含む、出荷時から利用可能なチャットボット機能を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト