raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
Rapid‑MLX – Apple Silicon 上の高速でローカルなAI
何であるか – Rapid‑MLX は、MLX ライブラリを使用して M‑シリーズの Mac で大規模言語モデル、視覚モデル、音声モデル、拡散モデルを ネイティブ に実行する Python ベースの推論エンジンです。コマンドラインツール(rapid‑mlx)と macOS デスクトップアプリを同梱しており、どちらも OpenAI 互換の HTTP API(/v1/...)を公開しています。これにより、OpenAI や Anthropic と通信できる任意のクライアント(例:LangChain、Aider、Claude Code、Codex CLI)を http://localhost:8000 に接続し、完全にオフラインで動作させることができます。
クイックスタート(60秒)
# インストール(Homebrew、pip、またはガイド付きインストーラー)
brew install rapid-mlx # または curl … | bash
# ターミナルでチャット(初回実行時に 4‑bit 4‑B モデルをダウンロード)
rapid-mlx chat
# または OpenAI 互換サーバーを起動
rapid-mlx serve qwen3.5-4b-4bit
これで curl または任意の OpenAI SDK でサーバーにアクセスできます:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'
コア機能
| カテゴリ | 動作方法 | 例となるモデル |
|---|---|---|
| テキスト生成 | 連続バッチ処理カーネル、プロンプトキャッシュ、量子化された KV キャッシュ(int4/int8) | qwen3.5-4b-4bit、qwen3.6-35b-8bit |
| 視覚 / 画像生成 | 拡散パイプライン(Flux、Stable Diffusion など)は /v1/images/* でアクセス |
flux2-klein-4b、z-image-turbo |
| 動画生成 | テキストから動画 / 画像から動画へのバックエンド(Wan、CogVideoX‑Fun、LTX) | wan2.2-ti2v-5b-q8 |
| 音声 | TTS、音声認識、ボイスクラーニング、強制同期は /v1/audio/* で利用可能 |
kokoro、whisper-large-v3-turbo、indextts |
| 埋め込み | 標準の OpenAI /v1/embeddings エンドポイント |
(同じテキストモデル) |
| エージェント統合 | 12種類の人気のあるコード/アシスタント CLI 用の事前検証済みアダプタ(Claude Code、Codex CLI、Aider など) | – |
インストール方法
| 方法 | インストールされるもの |
|---|---|
Homebrew (brew install rapid-mlx) |
事前ビルド済みバイナリ、rapid-mlx CLI を PATH に追加 |
| ガイド付きインストーラー (`curl … | bash`) |
pip/uv (pip install rapid-mlx) |
プア・Python インストール;パッケージを確認または修正可能 |
| デスクトップアプリ(rapidmlx.com からダウンロード) | 1クリックでGUIが起動。同じエンジンに加え、モデルマネージャーもバンドル |
OpenAI/Anthropic バックエンドとしての使用方法
- エンドポイント –
http://localhost:8000/v1(OpenAI)またはhttp://localhost:8000(Anthropic/v1/messages)。 - 認証 – ローカル使用には API キーは不要。公開サーバーとして公開する場合は
RAPID_MLX_API_KEYを設定できます。 - 対応ルート –
chat/completions、responses(Codex)、messages(Claude)、embeddings、images/generations、images/edits、videos、audio/*。 - クライアント互換性 – LangChain、Pydantic‑AI、OpenCode、Aider、Claude Code、およびローカル OpenAI 互換エンドポイントに接続できる任意のツールと互換。
エージェントサポート
Rapid‑MLX は 12 種類のコードエージェント用に ワイヤーテスト済みアダプタ を同梱しています。5 つは Tier‑1(Claude Code、Codex CLI、Hermes、Aider、DeepSeek Harness)で、リリースごとに実際のモデル重みに対して再テストされています。残りのエージェント(OpenCode、Qwen Code、OpenHands、Kilo Code、GitHub Copilot、Factory Droid、Moonshot Kimi Code)は Tier‑2 で、やや軽いテストスイートで検証されています。
1つのコマンドでエージェントを自動設定できます。たとえば:
rapid-mlx launch claude-code # Claude Code をローカルサーバーに接続するように修正
パフォーマンスのハイライト(README に記載)
- 同じハードウェア上で Ollama よりも 最大 3 倍のスループット(ベンチマークリンクあり)。
- M3 Ultra で
flux2-klein-4bを使用した画像生成は、1024×1024 画像あたり 約 9 秒。 - 動画生成は 1 クリップずつ実行。Wan 2.2 モデルで 1 秒のクリップ生成には数分の計算時間が必要。
- 量子化された KV キャッシュと連続バッチ処理により、メモリ使用量を抑え、16 GB〜32 GB の統合メモリを持つ Mac でも 35 B モデルを実行可能。
制限事項 / ポイント
- Apple‑silicon 限定 – エンジンは M1〜M4 で動作する MLX カーネルに依存しており、Windows や Linux 用バイナリは提供されていません。
- シングルフライト生成 – 拡散パイプライン(画像、動画)はシリアライズされています。統合メモリの制約により、2 つの生成を同時に実行できません。
- モデルライセンス – Rapid‑MLX は下位モデルのライセンスを再ライセンスしません。商用利用の前に各モデルの元の利用条件を尊重する必要があります。
- 公開暴露 – サーバーをインターネットにトンネルする場合は
RAPID_MLX_API_KEYを設定する必要があります。そうでなければエンドポイントは認証なしで、ローカルに留めるべきです。 - Python バージョン – コアのテキスト/音声処理は Python 3.10+ で動作しますが、動画ランタイムには Python 3.11+ が必要です。
次に進むべき場所
- ドキュメント – https://rapidmlx.com/docs/(完全な API リファレンス、モデルカタログ、ベンチマーク手法)
- モデルミラー – https://models.rapidmlx.com/(事前にキャッシュされた重みをダウンロード)
- デスクトップアプリ – https://rapidmlx.com/desktop で GUI 体験を
- コミュニティ – Discord サーバー(README にリンクあり)でサポート、モデル推奨、リリースのお知らせを
結論 – Rapid‑MLX は、Apple‑silicon Mac 用にプロダクションレベルのローカル推論スタックであり、OpenAI/Anthropic API を模倣することで、チャット、コードアシスタント、画像/動画生成、音声タスクのクラウド呼び出しを高速でプライベートな推論に簡単に置き換えることが可能になります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト