ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

解決的問題

mlx-serve 為 Apple Silicon Mac 提供高效率的本地推論伺服器,消除對 Python 或雲端依賴的需求。使用者可在自身硬體上,透過統一的標準 API 表面,執行大量 LLM(支援 MLX 與 GGUF 格式)以及多模態模型(影像、影片、音樂、語音與 3D)。

工作原理

以原生 Zig 二進位檔建構,伺服器整合了 MLX 與嵌入式 llama.cpp(用於 GGUF 支援)。它在單一通訊埠上提供四種相容的 API 表面:OpenAI、Anthropic、Ollama 與專用媒體端點。利用自訂 Metal 內核、連續批次處理,以及四種類型的預測解碼(PLD、草稿同伴、Gemma 4 草稿器、Qwen MTP),以在 Apple Silicon 上最大化解碼速度。

適用對象

使用 Apple Silicon Mac 的開發者與 AI 愛好者,希望獲得一個快速、獨立的本地推論伺服器,可無縫整合至 Claude Code、Cursor 與 Open WebUI 等既有工具,且無需 Python 或 Electron 應用的額外負擔。

主要特色

  • 統一模型支援: 可執行 MLX 與 GGUF 模型,包含 DeepSeek V4 Flash 等大型架構。
  • 多模態能力: 原生生成影像、影片、音樂、語音(支援語音克隆)與 3D 模型。
  • 多 API 兼容性: 可作為 OpenAI、Anthropic 與 Ollama API 的即插即用替代品。
  • 高效率: 透過先進的預測解碼與 Metal 內核,相同權重下解碼速度比 LM Studio 快達 26%。
  • MLX Core App: 一個已簽署的 macOS 菜單列應用程式,提供模型管理、聊天功能,以及用於代理 shell 命令的隔離式 Linux VM 沙箱。
  • 局域網路共用: 透過 Bonjour,可在本地網路中的多台 Mac 之間共用模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案