micytao/vllm-playground

A modern web interface for managing and interacting with vLLM servers (www.github.com/vllm-project/vllm). Supports both GPU and CPU modes, with special optimizations for macOS Apple Silicon and enterprise deployment on OpenShift/Kubernetes.

解決する課題

vLLMサーバーを管理・操作するためのモダンで使いやすいWebインターフェースを提供し、LLMサービングのために複雑なCLIコマンドを手動で設定する必要をなくします。さまざまなハードウェア (GPU, CPU, Apple Silicon) や環境 (ローカル、コンテナ、Kubernetes) でのオープンソースモデルのデプロイとテストを簡素化します。

仕組み

このプロジェクトは、ユーザーのブラウザとvLLMバックエンドの間に位置する管理レイヤー (FastAPIとJavaScriptで構築) として機能します。vLLMをサブプロセスとして起動したり、コンテナ経由で管理したり、リモートサーバーに接続したりできます。Model Context Protocol (MCP) と統合されており、モデルが外部ツールを使用できるようにするほか、vLLMをClaude Codeのバックエンドとして使用するための専用ターミナルインターフェースを提供します。

対象ユーザー

インフラ設定に毎回深く入り込むことなく、vLLMで提供されるモデルのデプロイ、ベンチマーク、チャットを視覚的に行いたいAI開発者や研究者向けに設計されています。

ハイライト

  • マルチインスタンス管理: タブインターフェースを使用して、複数のvLLMバックエンド (サブプロセス、コンテナ、またはリモート) を実行および切り替え可能。
  • マルチモーダルサポート: 音声/画像生成のためのvLLM-Omniとの統合、およびQwen2.5-VLのようなビジョンモデルとチャットするためのVLMサポート。
  • エージェント機能: ツール使用のためのMCPサポートを内蔵し、ローカルコーディング支援のためにClaude Codeと統合。
  • 柔軟なデプロイ: NVIDIA, AMD, TPU, CPU, Apple Silicon (Metal) アクセラレーションをサポートし、エンタープライズ向けのOpenShift/Kubernetesデプロイオプションも提供。
  • 高度な制御: 構造化出力制約 (JSON Schema, Regex)、さまざまなモデルファミリー向けのツール呼び出し、PagedAttention用の可観測性ダッシュボードが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト