waybarrios/vllm-mlx
OpenAI and Anthropic compatible server for Apple Silicon. Run LLMs and vision-language models (Llama, Qwen-VL, LLaVA) with continuous batching, MCP tool calling, and multimodal support. Native MLX backend, 400+ tok/s. Works with Claude Code.
What it solves
Apple Silicon Mac을 위한 고처리량 추론 서버를 제공하여, 일반적으로 기업용 서버에서 볼 수 있는 연속 배치(continuous batching) 및 페이지드 KV 캐싱(paged KV caching)과 같은 고급 서빙 기능을 로컬 하드웨어로 가져옵니다. 수동 모델 변환의 필요성을 제거하고, 사용자가 단일 통합 프로세스를 통해 다양한 멀티모달 모델(텍스트, 이미지, 영상, 오디오)을 실행할 수 있게 합니다.
How it works
Apple의 MLX 프레임워크와 Metal kernels를 기반으로 구축되어, 유니파이드 메모리를 활용하여 GPU에서 모델을 네이티브하게 실행합니다. 메모리 효율성을 위한 페이지드 KV 캐시, 반복되는 프롬프트 속도를 높이기 위한 trie-based prefix cache, 그리고 데이터를 디스크로 스필링(spilling)하여 긴 컨텍스트를 처리하는 SSD-tiered cache를 구현합니다. 이러한 기능은 OpenAI-compatible 및 Anthropic-compatible API를 통해 제공됩니다.
Who it’s for
M 시리즈 Mac을 사용하는 개발자 및 AI 연구자들이, 동시 요청, 멀티모달 입력, 또는 긴 컨텍스트를 가진 복잡한 에이전트 워크플로우를 처리할 수 있는 프로덕션급 로컬 추론 서버가 필요할 때 적합합니다.
Highlights
- Dual API Support: OpenAI
/v1/*และ Anthropic/v1/messages엔드포인트를 동시에 제공합니다. - Advanced Memory Management: 연속 배치(continuous batching), 페이지드 KV 캐시, SSD-tiered caching을 통한 긴 컨텍스트 처리를 특징으로 합니다.
- Multimodal Versatility: LLM, 비전 모델(예: Qwen3-VL, Llama vision), 오디오 STT (Whisper), 그리고 네이티브 TTS를 하나의 서버에서 지원합니다.
- Performance Optimizations: Speculative decoding, 더 빠른 Time-to-first-token을 위한 sparse prefill, 그리고 MoE expert reduction을 포함합니다.
- Developer Tooling: 내장된 Prometheus metrics와 프롬프트 스윕(prompt sweeps)을 위한 벤치마킹 도구를 제공합니다.