raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

解決的問題

Rapid-MLX 提供專為 Apple Silicon(M1 至 M4 晶片)優化的高效能本地 AI 引擎。透過提供比 Ollama 等替代方案快得多的原生 MLX 環境,同時保持與標準 OpenAI 和 Anthropic API 格式的相容性,消除了複雜設定或第三方 shim 的需求。

工作原理

該引擎使用純 MLX 核心來利用 Apple Silicon 的硬體頻寬。它實現了多種效能優化,包括連續批處理(continuous batching)、提示詞快取(使用 radix 與 DeltaNet RNN 快照)以及量化即時 KV 快取。它可以作為命令列介面 (CLI) 用於直接聊天,也可以作為模擬 OpenAI/Anthropic API 的 HTTP 伺服器進行部署,從而使其能夠作為各種 IDE 與代理人框架的後端。

適用對象

專為使用 M 系列 Mac 並希望以最高效率在本地執行 LLM 的開發者與 AI 愛好者設計,同時也適用於需要為 AI 代理人、程式碼助手(如 Cursor 或 Aider)以及 Python 框架(如 LangChain 或 PydanticAI)提供本地 API 後端的用戶。

亮點

  • Apple Silicon 原生: 基於純 MLX 核心構建,無需 llama.cpp 回退或 Metal shim。
  • API 相容性: 可直接替換 OpenAI 與 Anthropic API,支援 chat completions、messages、embeddings 與 audio 路由。
  • 廣泛的生態系統支援: 已通過 11 個代理人 CLI(包括 Claude Code 與 Aider)和 3 個主要 Python 框架的實測驗證。
  • 硬體感知: 內建 RAM 偵測器,可根據使用者的 Mac 配置建議特定的模型大小與量化方式。