ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

解决的问题

在 macOS 上运行大语言模型和生成式 AI 可能会消耗大量资源且过程复杂。本项目提供了一种高性能、原生的方式,可以在无需 Python 或 Electron 开销的情况下,在 Apple Silicon 上运行 LLM 和多模态模型(图像、视频、音乐、语音和 3D)。

工作原理

本项目由一个支持多种模型格式(包括通过嵌入式 llama.cpp 支持的 MLX 和 GGUF)的原生 Zig 服务器组成。它公开了与 OpenAI、Anthropic 和 Ollama 兼容的 API,使其能够与 Cursor、Claude Code 和 Open WebUI 等现有工具无缝集成。此外,它还包含一个名为 MLX Core 的 macOS 菜单栏应用,供偏好使用图形界面进行模型管理、聊天和智能体工作流的用户使用。

适用对象

  • 希望为其应用程序寻找快速、本地且无需 Python 的推理引擎的开发者
  • 正在寻找在 Mac 硬件上运行多种模型(文本、图像、视频等)的高性能方法 AI 爱好者
  • 希望通过兼容 API 在现有工作流中使用本地模型的高级用户

亮点

  • 多模态支持:生成文本、图像、视频、音乐、语音(带语音克隆)和 3D 模型。
  • 高性能:功能包括投机解码 (speculative decoding)、连续批处理 (continuous batching) 以及用于快速预填充 (prefilling) 的自定义 Metal 内核。
  • 广泛的兼容性:支持 MLX 和 GGUF 格式,并提供兼容 OpenAI、Anthropic 和 Ollama 的 API。
  • 高级功能:包括智能体沙箱(隔离的 Linux VM)、局域网模型共享和 KV-cache 量化。
  • 零依赖运行时:使用 Zig 构建,运行二进制文件无需安装 Python。