micytao/vllm-playground

A modern web interface for managing and interacting with vLLM servers (www.github.com/vllm-project/vllm). Supports both GPU and CPU modes, with special optimizations for macOS Apple Silicon and enterprise deployment on OpenShift/Kubernetes.

해결하는 문제

vLLM 서버를 관리하고 상호 작용하기 위한 현대적이고 사용자 친화적인 웹 인터페이스를 제공하여, LLM 서빙을 위해 복잡한 CLI 명령어를 수동으로 구성할 필요를 없애줍니다. 다양한 하드웨어 (GPU, CPU, Apple Silicon) 및 환경 (로컬, 컨테이너, Kubernetes) 전반에서 오픈 소스 모델의 배포 및 테스트를 간소화합니다.

작동 방식

이 프로젝트는 사용자의 브라우저와 vLLM 백엔드 사이에 위치하는 관리 계층 (FastAPI 및 JavaScript로 구축) 역할을 합니다. vLLM을 하위 프로세스로 실행하거나, 컨테이너를 통해 관리하거나, 원격 서버에 연결할 수 있습니다. Model Context Protocol (MCP) 과 통합되어 모델이 외부 도구를 사용할 수 있도록 하며, vLLM을 Claude Code의 백엔드로 사용하기 위한 특수 터미널 인터페이스를 제공합니다.

대상 사용자

매번 인프라 구성에 깊이 관여하지 않고도 vLLM으로 제공되는 모델을 시각적으로 배포, 벤치마킹 및 채팅하고 싶은 AI 개발자와 연구자를 위해 설계되었습니다.

주요 특징

  • 멀티 인스턴스 관리: 탭 인터페이스를 사용하여 여러 vLLM 백엔드 (하위 프로세스, 컨테이너 또는 원격) 를 실행하고 전환합니다.
  • 멀티모달 지원: 오디오/이미지 생성을 위한 vLLM-Omni 통합 및 Qwen2.5-VL과 같은 비전 모델과 채팅하기 위한 VLM 지원.
  • 에이전트 기능: 도구 사용을 위한 MCP 지원 내장 및 로컬 코딩 지원을 위한 Claude Code와의 통합.
  • 유연한 배포: NVIDIA, AMD, TPU, CPU 및 Apple Silicon (Metal) 가속을 지원하며, 엔터프라이즈급 OpenShift/Kubernetes 배포 옵션을 제공합니다.
  • 고급 제어: 구조화된 출력 제약 조건 (JSON Schema, Regex), 다양한 모델 제품군을 위한 도구 호출, PagedAttention을 위한 관측 가능성 대시보드가 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트