ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

解决的问题

mlx-serve 为 Apple Silicon Mac 提供高性能的本地推理服务器,消除了对 Python 或云依赖的需求。用户可以在自己的硬件上,通过统一的标准 API 表面运行大量 LLM(支持 MLX 和 GGUF 格式)以及多模态模型(图像、视频、音乐、语音和 3D)。

工作原理

作为原生 Zig 二进制文件构建,该服务器集成了 MLX 和嵌入式 llama.cpp(用于 GGUF 支持)。它在单个端口上暴露四种兼容的 API 表面:OpenAI、Anthropic、Ollama 和专用媒体端点。它利用自定义 Metal 内核、连续批处理以及四种类型的推测解码(PLD、草稿同伴、Gemma 4 草稿器、Qwen MTP),以在 Apple Silicon 上最大化解码速度。

适用人群

使用 Apple Silicon Mac 的开发者和 AI 爱好者,他们希望获得一个快速、独立的本地推理服务器,可无缝集成到 Claude Code、Cursor 和 Open WebUI 等现有工具中,而无需 Python 或 Electron 应用的开销。

主要亮点

  • 统一模型支持: 支持运行 MLX 和 GGUF 模型,包括 DeepSeek V4 Flash 等大型架构。
  • 多模态能力: 原生生成图像、视频、音乐、语音(支持语音克隆)和 3D 模型。
  • 多 API 兼容性: 可作为 OpenAI、Anthropic 和 Ollama API 的即插即用替代品。
  • 高性能: 通过先进的推测解码和 Metal 内核,相同权重下解码速度比 LM Studio 快高达 26%。
  • MLX Core App: 一个已签名的 macOS 菜单栏应用,提供模型管理、聊天功能,以及用于代理 shell 命令的隔离 Linux VM沙箱。
  • 局域网共享: 通过 Bonjour,可在本地网络中的多台 Mac 之间共享模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目