waybarrios/vllm-mlx

OpenAI and Anthropic compatible server for Apple Silicon. Run LLMs and vision-language models (Llama, Qwen-VL, LLaVA) with continuous batching, MCP tool calling, and multimodal support. Native MLX backend, 400+ tok/s. Works with Claude Code.

What it solves

它专门为 Apple Silicon Mac 提供高吞吐量的推理服务器,将通常见于企业级服务器的高级服务功能(如连续批处理与分页 KV 缓存)带到本地硬件。它消除了手动模型转换的需求,并允许用户通过单一统一的过程来运行各种多模态模型(文本、图像、视频、音频)。

How it works

基于 Apple 的 MLX 框架与 Metal kernels,该服务器利用统一内存来在 GPU 上原生运行模型。它实现了 vLLM 风格的架构,包括用于提高内存效率的分页 KV 缓存,用于加速重复提示词的 trie-based prefix cache,以及用于处理长上下文代理 (agentic workflows) 的 SSD-tiered cache,通过将数据溢出到磁盘以处理长上下文。它通过 OpenAI-compatible 与 Anthropic-compatible API 提供这些功能。

Who it’s for

使用 M 系列 Mac 的开发者与 AI 研究人员,需要能够处理并发请求、多模态输入或具有长上下文的复杂代理工作流的生产级本地推理服务器。

Highlights

  • Dual API Support: 同时提供 OpenAI /v1/* 与 Anthropic /v1/messages 端点。
  • Advanced Memory Management: 提供连续批处理、分页 KV 缓存,以及针对长上下文的 SSD-tiered caching。
  • Multimodal Versatility: 在单一服务器中支持 LLM, 视觉模型 (例如 Qwen3-VL, Llama vision), 音频 STT (Whisper), 与原生 TTS。
  • Performance Optimizations: 包含投机性解码 (speculative decoding), 稀疏预填充 (sparse prefill) 以加快首字生成时间 (time-to-first-token), 与 MoE 专家减少 (expert reduction)。
  • Developer Tooling: 内置 Prometheus metrics 与用于提示词扫描 (prompt sweeps) 的基准测试工具。