raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
解決的問題
Rapid-MLX 提供專為 Apple Silicon(M1 至 M4 晶片)優化的高效能本地 AI 引擎。透過提供比 Ollama 等替代方案快得多的原生 MLX 環境,同時保持與標準 OpenAI 和 Anthropic API 格式的相容性,消除了複雜設定或第三方 shim 的需求。
工作原理
該引擎使用純 MLX 核心來利用 Apple Silicon 的硬體頻寬。它實現了多種效能優化,包括連續批處理(continuous batching)、提示詞快取(使用 radix 與 DeltaNet RNN 快照)以及量化即時 KV 快取。它可以作為命令列介面 (CLI) 用於直接聊天,也可以作為模擬 OpenAI/Anthropic API 的 HTTP 伺服器進行部署,從而使其能夠作為各種 IDE 與代理人框架的後端。
適用對象
專為使用 M 系列 Mac 並希望以最高效率在本地執行 LLM 的開發者與 AI 愛好者設計,同時也適用於需要為 AI 代理人、程式碼助手(如 Cursor 或 Aider)以及 Python 框架(如 LangChain 或 PydanticAI)提供本地 API 後端的用戶。
亮點
- Apple Silicon 原生: 基於純 MLX 核心構建,無需 llama.cpp 回退或 Metal shim。
- API 相容性: 可直接替換 OpenAI 與 Anthropic API,支援 chat completions、messages、embeddings 與 audio 路由。
- 廣泛的生態系統支援: 已通過 11 個代理人 CLI(包括 Claude Code 與 Aider)和 3 個主要 Python 框架的實測驗證。
- 硬體感知: 內建 RAM 偵測器,可根據使用者的 Mac 配置建議特定的模型大小與量化方式。