waybarrios/vllm-mlx
OpenAI and Anthropic compatible server for Apple Silicon. Run LLMs and vision-language models (Llama, Qwen-VL, LLaVA) with continuous batching, MCP tool calling, and multimodal support. Native MLX backend, 400+ tok/s. Works with Claude Code.
What it solves
它專為 Apple Silicon Mac 提供高吞吐量的推理伺服器,將通常見於企業級伺服器的進階服務功能(如連續批處理與分頁 KV 快取)帶到本地硬體。它消除了手動模型轉換的需求,並允許使用者透過單一統一的流程來運行各種多模態模型(文字、圖像、影片、音訊)。
How it works
基於 Apple 的 MLX 框架與 Metal kernels,該伺服器利用統一記憶體在 GPU 上原生運行模型。它實現了 vLLM 風格的架構,包括用於提高記憶體效率的分頁 KV 快取、用於加速重複提示詞的 trie-based prefix cache,以及用於處理長上下文代理(agentic workflows)的 SSD-tiered cache,透過將數據溢出到磁碟來處理。它透過 OpenAI-compatible 與 Anthropic-compatible API 提供這些功能。
Who it’s for
使用 M 系列 Mac 的開發者與 AI 研究人員,需要能夠處理併發請求、多模態輸入或具有長上下文的複雜代理工作流的生產級本地推理伺服器。
Highlights
- Dual API Support: 同時提供 OpenAI
/v1/*與 Anthropic/v1/messages端點。 - Advanced Memory Management: 提供連續批處理、分頁 KV 快取,以及針對長上下文的 SSD-tiered caching。
- Multimodal Versatility: 在單一伺服器中支援 LLM、視覺模型(例如 Qwen3-VL, Llama vision)、音訊 STT (Whisper) 與原生 TTS。
- Performance Optimizations: 包含投機性解碼(speculative decoding)、用於加速首字生成時間(time-to-first-token)的稀疏預填充(sparse prefill),以及 MoE 專家減少(expert reduction)。
- Developer Tooling: 內建 Prometheus metrics 與用於提示詞掃描(prompt sweeps)的基準測試工具。