raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
解决的问题
Rapid-MLX 提供专为 Apple Silicon(M1 至 M4 芯片)优化的高性能本地 AI 引擎。通过提供比 Ollama 等替代方案快得多的原生 MLX 环境,同时保持与标准 OpenAI 和 Anthropic API 格式的兼容性,消除了复杂设置或第三方 shim 的需求。
工作原理
该引擎使用纯 MLX 内核来利用 Apple Silicon 的硬件带宽。它实现了多种性能优化,包括连续批处理(continuous batching)、提示词缓存(使用 radix 和 DeltaNet RNN 快照)以及量化实时 KV 缓存。它可以作为命令行界面 (CLI) 用于直接聊天,也可以作为模拟 OpenAI/Anthic API 的 HTTP 服务器进行部署,从而使其能够作为各种 IDE 和智能体框架的后端。
适用对象
专为使用 M 系列 Mac 并希望以最高效率在本地运行 LLM 的开发者和 AI 爱好者设计,同时也适用于需要为 AI 智能体、编程助手(如 Cursor 或 Aider)以及 Python 框架(如 LangChain 或 PydanticAI)提供本地 API 后端的用户。
亮点
- Apple Silicon 原生: 基于纯 MLX 内核构建,无需 llama.cpp 回退或 Metal shim。
- API 兼容性: 可直接替换 OpenAI 和 Anthropic API,支持 chat completions、messages、embeddings 和 audio 路由。
- 广泛的生态系统支持: 已通过 11 个智能体 CLI(包括 Claude Code 和 Aider)和 3 个主要 Python 框架的实测验证。
- 硬件感知: 内置 RAM 检测器,可根据用户的 Mac 配置推荐特定的模型大小和量化方式。