raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

Rapid‑MLX – 在 Apple Silicon 上快速、本地運行的 AI

這是什麼 – Rapid‑MLX 是一個基於 Python 的推理引擎,可使用 MLX 庫在 M 系列 Mac 上原生運行大型語言、視覺、音訊和擴散模型。它附帶一個命令列工具(rapid‑mlx)和一個 macOS 桌面應用程式,兩者均提供 OpenAI 兼容的 HTTP API/v1/...),因此任何能與 OpenAI 或 Anthropic 通訊的客戶端(例如 LangChain、Aider、Claude Code、Codex CLI)均可指向 http://localhost:8000,並完全離線運行。


快速入門(60 秒)

# 安裝(Homebrew、pip 或引導式安裝程式)
brew install rapid-mlx   # 或 curl … | bash

# 在終端機中對話(首次執行時會下載 4 位元的 4‑B 模型)
rapid-mlx chat

# 或啟動 OpenAI 兼容伺服器
rapid-mlx serve qwen3.5-4b-4bit

現在您可以使用 curl 或任何 OpenAI SDK 呼叫伺服器:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'

核心功能

類別 工作原理 範例模型
文字生成 連續批次運算核心、提示快取、量化 KV 快取(int4/int8) qwen3.5-4b-4bitqwen3.6-35b-8bit
視覺 / 圖像生成 透過 /v1/images/* 存取擴散管道(Flux、Stable Diffusion 等) flux2-klein-4bz-image-turbo
影片生成 文字轉影片 / 圖像轉影片後端(Wan、CogVideoX‑Fun、LTX) wan2.2-ti2v-5b-q8
音訊 TTS、語音辨識、語音克隆、強制對齊,透過 /v1/audio/* kokorowhisper-large-v3-turboindextts
嵌入向量 標準 OpenAI /v1/embeddings 端點 (相同文字模型)
代理整合 為 12 種常見的程式碼/助理 CLI 提供預先驗證的轉接器(Claude Code、Codex CLI、Aider 等)

安裝選項

方法 您將獲得
Homebrewbrew install rapid-mlx 預先建置的二進位檔,將 rapid-mlx CLI 加入您的 PATH
引導式安裝程式(`curl … bash`)
pip/uvpip install rapid-mlx 純 Python 安裝;可檢視或修改套件
桌面應用程式(從 rapidmlx.com 下載) 一鍵式 GUI,內建相同引擎與模型管理器

作為 OpenAI/Anthropic 的即插即用後端使用

  • 端點http://localhost:8000/v1(OpenAI)或 http://localhost:8000(Anthropic /v1/messages)。
  • 驗證 – 本地使用時不需要 API 金鑰;若公開暴露伺服器,可設定 RAPID_MLX_API_KEY
  • 支援的路由chat/completionsresponses(Codex)、messages(Claude)、embeddingsimages/generationsimages/editsvideosaudio/*
  • 客戶端相容性 – 可與 LangChain、Pydantic‑AI、OpenCode、Aider、Claude Code,以及任何可設定為連接本地 OpenAI 兼容端點的工具搭配使用。

代理支援

Rapid‑MLX 提供 線路驗證轉接器,支援 12 種程式碼代理。其中五種標記為 一級(Claude Code、Codex CLI、Hermes、Aider、DeepSeek Harness),每次發行都會針對實際模型權重重新測試。其餘代理(OpenCode、Qwen Code、OpenHands、Kilo Code、GitHub Copilot、Factory Droid、Moonshot Kimi Code)為二級,同樣經過驗證,但測試套件稍輕。

您可透過單一指令自動設定代理,例如:

rapid-mlx launch claude-code   # 將 Claude Code 設定為使用本機伺服器

性能亮點(如 README 所聲稱)

  • 在相同硬體上,吞吐量最高達 Ollama 的 3 倍(提供測試連結)。
  • 使用 flux2-klein-4b 生成圖像,在 M3 Ultra 上每張 1024×1024 圖像約需 9 秒
  • 影片生成一次僅能執行一個片段;使用 Wan 2.2 模型生成 1 秒片段需數分鐘的運算時間。
  • 量化 KV 快取與連續批次處理可將記憶體使用量維持在低水準,讓 35 B 模型能在具備 16 GB–32 GB 統一記憶體的 Mac 上運行。

局限性 / 注意事項

  • 僅限 Apple Silicon – 引擎依賴於在 M1–M4 上執行的 MLX 核心;不提供 Windows 或 Linux 二進位檔。
  • 單一飛行生成 – 擴散管道(圖像、影片)為序列化;因統一記憶體限制,無法同時執行兩個生成任務。
  • 模型授權 – Rapid‑MLX 不重新授權底層模型;您必須在商業使用前遵守各模型的原始條款。
  • 公開暴露 – 若將伺服器隧道至網際網路,必須設定 RAPID_MLX_API_KEY;否則端點未經驗證,應僅限本地使用。
  • Python 版本 – 核心文字/音訊功能支援 Python 3.10+,但影片執行環境需要 Python 3.11+。

接下來該做什麼


總結 – Rapid‑MLX 是一個生產級、在 Apple Silicon Mac 上本地運行的推理堆疊,模擬 OpenAI/Anthropic API,讓您輕鬆以快速、私密的推理取代雲端呼叫,適用於對話、程式碼助理、圖像/影片生成與音訊任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案