InftyAI/llmaz
☸️ Easy, advanced inference platform for large language models on Kubernetes. 🌟 Star to support our work!
何を解決するか
llmaz は Kubernetes 上で大規模言語モデル(LLM)のデプロイと管理を簡素化する、本番環境対応の推論プラットフォームです。手動でのインフラ構成、モデルの読み込み、スケーリングの複雑さを排除し、高性能なAIサービスの提供を可能にします。
動作方法
llmaz は Kubernetes 上のオーケストレーション層として機能し、vLLM、TensorRT-LLM、llama.cpp などの最先端の推論バックエンドと統合します。HuggingFace や ModelScope などのプロバイダーからモデルウェイトを自動的に読み込み、モデルサービスのライフサイクルを管理します。また、分散推論をサポートし、AI Gateway と統合してトラフィック管理を行い、Karpenter によるノードの自動スケーリングも可能にします。
対象ユーザー
Kubernetes 上で LLM を本番環境にデプロイする必要があるクラウドエンジニア、MLOpsエンジニア、開発者で、最小限の構成と全体的なインフラのオーバーヘッドで運用したい方。
主な特徴
- 広範なバックエンド対応: vLLM、Text-Generation-Inference、SGLang、llama.cpp、TensorRT-LLM に対応。
- 自動モデル読み込み: HuggingFace、ModelScope、ObjectStores からのモデルウェイトを自動で処理。
- 異種クラスタ対応: InftyAI スケジューラを使用して、異なる種類のデバイス間でモデルを配信可能。
- スケーリング効率: LLM メトリクスに基づく水平ポッドスケーリングと、Karpenter によるノード自動スケーリングをサポート。
- 統合された AI Gateway: Envoy AI Gateway を通じてトークンベースのレート制限とモデルルーティングを提供。
- 組み込みチャットUI: Open WebUI と統合し、RAG や関数呼び出しを含む、出荷時から利用可能なチャットボット機能を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト