ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

解決的問題

在 macOS 上執行大型語言模型與生成式 AI 可能會消耗大量資源且過程複雜。本專案提供了一種高效能、原生的方式,可以在無需 Python 或 Electron 開銷的情況下,於 Apple Silicon 上執行 LLM 與多模態模型(圖像、影片、音樂、語音與 3D)。

工作原理

本專案由一個支援多種模型格式(包括透過嵌入式 llama.cpp 支援 MLX 與 GGUF)的原生 Zig 伺服器組成。它公開了與 OpenAI、Anthropic 與 Ollama 相容的 API,使其能夠與 Cursor、Claude Code 與 Open WebUI 等現有工具無縫整合。此外,它還包含一個名為 MLX Core 的 macOS 選單列應用程式,供偏好使用圖形介面進行模型管理、聊天與代理工作流的使用者使用。

適用對象

  • 希望為其應用程式尋找快速、本地且無需 Python 的推理引擎的開發者
  • 正在尋找在 Mac 硬體上執行多種模型(文本、圖像、影片等)的高效能方法之 AI 愛好者
  • 希望透過相容 API 在現有工作流中使用本地模型的進階使用者

亮點

  • 多模態支援:生成文本、圖像、影片、音樂、語音(含語音複製)與 3D 模型。
  • 高效能:功能包括投機解碼 (speculative decoding)、連續批處理 (continuous batching) 以及用於快速預填充 (prefilling) 的自定義 Metal 核心。
  • 廣泛的相容性:支援 MLX 與 GGUF 格式,並提供相容 OpenAI、Anthropic 與 Ollama 的 API。
  • 進階功能:包括代理人沙盒(隔離的 Linux VM)、區域網路模型共享與 KV-cache 量化。
  • 零依賴執行階段:使用 Zig 建置,執行二進位檔案無需安裝 Python。