raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
Rapid‑MLX – 在 Apple Silicon 上快速、本地运行的 AI
是什么 – Rapid‑MLX 是一个基于 Python 的推理引擎,可使用 MLX 库在 M 系列 Mac 上原生运行大型语言、视觉、音频和扩散模型。它提供一个命令行工具(rapid‑mlx)和一个 macOS 桌面应用程序,两者均暴露一个 OpenAI 兼容的 HTTP API(/v1/...),因此任何与 OpenAI 或 Anthropic 通信的客户端(例如 LangChain、Aider、Claude Code、Codex CLI)都可以指向 http://localhost:8000 并完全离线运行。
快速入门(60 秒)
# 安装(Homebrew、pip 或引导安装程序)
brew install rapid-mlx # 或 curl … | bash
# 在终端中聊天(首次运行时会下载一个 4 位 4B 模型)
rapid-mlx chat
# 或启动一个 OpenAI 兼容的服务器
rapid-mlx serve qwen3.5-4b-4bit
现在你可以使用 curl 或任何 OpenAI SDK 调用该服务器:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'
核心功能
| 类别 | 工作方式 | 示例模型 |
|---|---|---|
| 文本生成 | 连续批处理内核、提示缓存、量化 KV 缓存(int4/int8) | qwen3.5-4b-4bit,qwen3.6-35b-8bit |
| 视觉 / 图像生成 | 通过 /v1/images/* 访问扩散管道(Flux、Stable Diffusion 等) |
flux2-klein-4b,z-image-turbo |
| 视频生成 | 文本到视频 / 图像到视频后端(Wan、CogVideoX‑Fun、LTX) | wan2.2-ti2v-5b-q8 |
| 音频 | TTS、转录、语音克隆、强制对齐通过 /v1/audio/* |
kokoro,whisper-large-v3-turbo,indextts |
| 嵌入 | 标准 OpenAI /v1/embeddings 端点 |
(与文本模型相同) |
| 代理集成 | 为 12 个流行的编码/助手 CLI 提供预验证适配器(Claude Code、Codex CLI、Aider 等) | – |
安装选项
| 方法 | 你将获得 |
|---|---|
Homebrew (brew install rapid-mlx) |
预构建二进制文件,将 rapid-mlx CLI 添加到你的 PATH |
| 引导安装程序 (`curl … | bash`) |
pip/uv (pip install rapid-mlx) |
纯 Python 安装;你可以检查或修改该包 |
| 桌面应用(从 rapidmlx.com 下载) | 一键式 GUI,捆绑相同引擎及模型管理器 |
作为 OpenAI/Anthropic 的即插即用后端使用
- 端点 –
http://localhost:8000/v1(OpenAI)或http://localhost:8000(Anthropic/v1/messages)。 - 认证 – 本地使用无需 API 密钥;如果你公开暴露服务器,可以设置
RAPID_MLX_API_KEY。 - 支持的路由 –
chat/completions、responses(Codex)、messages(Claude)、embeddings、images/generations、images/edits、videos、audio/*。 - 客户端兼容性 – 与 LangChain、Pydantic‑AI、OpenCode、Aider、Claude Code 以及任何可配置为连接本地 OpenAI 兼容端点的工具兼容。
代理支持
Rapid‑MLX 提供 线路验证适配器,支持 12 个编码代理。其中五个标记为 一级(Claude Code、Codex CLI、Hermes、Aider、DeepSeek Harness),每次发布都会使用真实模型权重重新测试。其余代理(OpenCode、Qwen Code、OpenHands、Kilo Code、GitHub Copilot、Factory Droid、Moonshot Kimi Code)为二级,也经过验证,但测试套件稍轻。
你可以通过一条命令自动配置代理,例如:
rapid-mlx launch claude-code # 将 Claude Code 配置为使用本地服务器
性能亮点(如 README 所述)
- 在相同硬件上,吞吐量最高可达 Ollama 的 3 倍(提供基准链接)。
- 使用
flux2-klein-4b生成图像,在 M3 Ultra 上每张 1024×1024 图像耗时 约 9 秒。 - 视频生成一次仅运行一个片段;使用 Wan 2.2 模型生成 1 秒片段需要数分钟计算时间。
- 量化 KV 缓存和连续批处理使内存使用量保持低位,足以在配备 16 GB–32 GB 统一内存的 Mac 上运行 35 B 模型。
限制 / 注意事项
- 仅限 Apple Silicon – 该引擎依赖于在 M1–M4 上运行的 MLX 内核;不提供 Windows 或 Linux 二进制文件。
- 单次生成 – 扩散管道(图像、视频)是串行的;由于统一内存限制,无法同时运行两个生成任务。
- 模型许可 – Rapid‑MLX 不重新许可底层模型;在商业使用前,你必须遵守每个模型的原始条款。
- 公开暴露 – 如果你将服务器隧道到互联网,必须设置
RAPID_MLX_API_KEY;否则端点未认证,应保持本地使用。 - Python 版本 – 核心文本/音频功能支持 Python 3.10+,但视频运行时需要 Python 3.11+。
下一步去哪里
- 文档 – https://rapidmlx.com/docs/(完整 API 参考、模型目录、基准方法)
- 模型镜像 – https://models.rapidmlx.com/(下载预缓存权重)
- 桌面应用 – https://rapidmlx.com/desktop 以获得 GUI 体验
- 社区 – Discord 服务器(README 中的链接)用于获取帮助、模型推荐和发布公告。
总结 – Rapid‑MLX 是一个生产级、本地运行的推理堆栈,专为 Apple Silicon Mac 设计,模拟 OpenAI/Anthropic API,使你能够轻松将云端调用替换为快速、私密的本地推理,适用于聊天、编码助手、图像/视频生成和音频任务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目