raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

Rapid‑MLX – 在 Apple Silicon 上快速、本地运行的 AI

是什么 – Rapid‑MLX 是一个基于 Python 的推理引擎,可使用 MLX 库在 M 系列 Mac 上原生运行大型语言、视觉、音频和扩散模型。它提供一个命令行工具(rapid‑mlx)和一个 macOS 桌面应用程序,两者均暴露一个 OpenAI 兼容的 HTTP API/v1/...),因此任何与 OpenAI 或 Anthropic 通信的客户端(例如 LangChain、Aider、Claude Code、Codex CLI)都可以指向 http://localhost:8000 并完全离线运行。


快速入门(60 秒)

# 安装(Homebrew、pip 或引导安装程序)
brew install rapid-mlx   # 或 curl … | bash

# 在终端中聊天(首次运行时会下载一个 4 位 4B 模型)
rapid-mlx chat

# 或启动一个 OpenAI 兼容的服务器
rapid-mlx serve qwen3.5-4b-4bit

现在你可以使用 curl 或任何 OpenAI SDK 调用该服务器:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'

核心功能

类别 工作方式 示例模型
文本生成 连续批处理内核、提示缓存、量化 KV 缓存(int4/int8) qwen3.5-4b-4bitqwen3.6-35b-8bit
视觉 / 图像生成 通过 /v1/images/* 访问扩散管道(Flux、Stable Diffusion 等) flux2-klein-4bz-image-turbo
视频生成 文本到视频 / 图像到视频后端(Wan、CogVideoX‑Fun、LTX) wan2.2-ti2v-5b-q8
音频 TTS、转录、语音克隆、强制对齐通过 /v1/audio/* kokorowhisper-large-v3-turboindextts
嵌入 标准 OpenAI /v1/embeddings 端点 (与文本模型相同)
代理集成 为 12 个流行的编码/助手 CLI 提供预验证适配器(Claude Code、Codex CLI、Aider 等)

安装选项

方法 你将获得
Homebrew (brew install rapid-mlx) 预构建二进制文件,将 rapid-mlx CLI 添加到你的 PATH
引导安装程序 (`curl … bash`)
pip/uv (pip install rapid-mlx) 纯 Python 安装;你可以检查或修改该包
桌面应用(从 rapidmlx.com 下载) 一键式 GUI,捆绑相同引擎及模型管理器

作为 OpenAI/Anthropic 的即插即用后端使用

  • 端点http://localhost:8000/v1(OpenAI)或 http://localhost:8000(Anthropic /v1/messages)。
  • 认证 – 本地使用无需 API 密钥;如果你公开暴露服务器,可以设置 RAPID_MLX_API_KEY
  • 支持的路由chat/completionsresponses(Codex)、messages(Claude)、embeddingsimages/generationsimages/editsvideosaudio/*
  • 客户端兼容性 – 与 LangChain、Pydantic‑AI、OpenCode、Aider、Claude Code 以及任何可配置为连接本地 OpenAI 兼容端点的工具兼容。

代理支持

Rapid‑MLX 提供 线路验证适配器,支持 12 个编码代理。其中五个标记为 一级(Claude Code、Codex CLI、Hermes、Aider、DeepSeek Harness),每次发布都会使用真实模型权重重新测试。其余代理(OpenCode、Qwen Code、OpenHands、Kilo Code、GitHub Copilot、Factory Droid、Moonshot Kimi Code)为二级,也经过验证,但测试套件稍轻。

你可以通过一条命令自动配置代理,例如:

rapid-mlx launch claude-code   # 将 Claude Code 配置为使用本地服务器

性能亮点(如 README 所述)

  • 在相同硬件上,吞吐量最高可达 Ollama 的 3 倍(提供基准链接)。
  • 使用 flux2-klein-4b 生成图像,在 M3 Ultra 上每张 1024×1024 图像耗时 约 9 秒
  • 视频生成一次仅运行一个片段;使用 Wan 2.2 模型生成 1 秒片段需要数分钟计算时间。
  • 量化 KV 缓存和连续批处理使内存使用量保持低位,足以在配备 16 GB–32 GB 统一内存的 Mac 上运行 35 B 模型。

限制 / 注意事项

  • 仅限 Apple Silicon – 该引擎依赖于在 M1–M4 上运行的 MLX 内核;不提供 Windows 或 Linux 二进制文件。
  • 单次生成 – 扩散管道(图像、视频)是串行的;由于统一内存限制,无法同时运行两个生成任务。
  • 模型许可 – Rapid‑MLX 不重新许可底层模型;在商业使用前,你必须遵守每个模型的原始条款。
  • 公开暴露 – 如果你将服务器隧道到互联网,必须设置 RAPID_MLX_API_KEY;否则端点未认证,应保持本地使用。
  • Python 版本 – 核心文本/音频功能支持 Python 3.10+,但视频运行时需要 Python 3.11+。

下一步去哪里


总结 – Rapid‑MLX 是一个生产级、本地运行的推理堆栈,专为 Apple Silicon Mac 设计,模拟 OpenAI/Anthropic API,使你能够轻松将云端调用替换为快速、私密的本地推理,适用于聊天、编码助手、图像/视频生成和音频任务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目