micytao/vllm-playground
A modern web interface for managing and interacting with vLLM servers (www.github.com/vllm-project/vllm). Supports both GPU and CPU modes, with special optimizations for macOS Apple Silicon and enterprise deployment on OpenShift/Kubernetes.
解決する課題
vLLMサーバーを管理・操作するためのモダンで使いやすいWebインターフェースを提供し、LLMサービングのために複雑なCLIコマンドを手動で設定する必要をなくします。さまざまなハードウェア (GPU, CPU, Apple Silicon) や環境 (ローカル、コンテナ、Kubernetes) でのオープンソースモデルのデプロイとテストを簡素化します。
仕組み
このプロジェクトは、ユーザーのブラウザとvLLMバックエンドの間に位置する管理レイヤー (FastAPIとJavaScriptで構築) として機能します。vLLMをサブプロセスとして起動したり、コンテナ経由で管理したり、リモートサーバーに接続したりできます。Model Context Protocol (MCP) と統合されており、モデルが外部ツールを使用できるようにするほか、vLLMをClaude Codeのバックエンドとして使用するための専用ターミナルインターフェースを提供します。
対象ユーザー
インフラ設定に毎回深く入り込むことなく、vLLMで提供されるモデルのデプロイ、ベンチマーク、チャットを視覚的に行いたいAI開発者や研究者向けに設計されています。
ハイライト
- マルチインスタンス管理: タブインターフェースを使用して、複数のvLLMバックエンド (サブプロセス、コンテナ、またはリモート) を実行および切り替え可能。
- マルチモーダルサポート: 音声/画像生成のためのvLLM-Omniとの統合、およびQwen2.5-VLのようなビジョンモデルとチャットするためのVLMサポート。
- エージェント機能: ツール使用のためのMCPサポートを内蔵し、ローカルコーディング支援のためにClaude Codeと統合。
- 柔軟なデプロイ: NVIDIA, AMD, TPU, CPU, Apple Silicon (Metal) アクセラレーションをサポートし、エンタープライズ向けのOpenShift/Kubernetesデプロイオプションも提供。
- 高度な制御: 構造化出力制約 (JSON Schema, Regex)、さまざまなモデルファミリー向けのツール呼び出し、PagedAttention用の可観測性ダッシュボードが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト