raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
解決する課題
Rapid-MLXは、Apple Silicon(M1からM4チップ)に特化して最適化された高パフォーマンスなローカルAIエンジンを提供します。標準的なOpenAIおよびAnthropicのAPI形式との互換性を維持しつつ、Ollamaのような代替手段よりも大幅に高速なネイティブMLXベースの環境を提供することで、複雑なセットアップやサードパーティのシム(shim)の必要性を排除します。
仕組み
このエンジンは、純粋なMLXカーネルを使用してApple Siliconのハードウェア帯域幅を活用します。連続バッチ処理(continuous batching)、プロンプトキャッシュ(radixおよびDeltaNet RNNスナップショットを使用)、量子化されたライブKVキャッシュを含む、いくつかのパフォーマンス最適化を実装しています。直接チャットするためのコマンドラインインターフェース(CLI)として、またはOpenAI/Anthropic APIを模倣するHTTPサーバーとしてデプロイでき、さまざまなIDEやエージェントフレームワークのバックエンドとして機能させることが可能です。
対象ユーザー
MシリーズMacを使用しており、LLMを最大限の効率でローカル実行したい開発者やAI愛好家、およびAIエージェント、コーディングアシスタント(CursorやAiderなど)、Pythonフレームワーク(LangChainやPydanticAIなど)のためにローカルAPIバックエンドを必要とするユーザー向けに設計されています。
ハイライト
- Apple Silicon Native: llama.cppのフォールバックやMetalシムを使用せず、純粋なMLXカーネルに基づいて構築されています。
- API互換性: OpenAIおよびAnthropic APIのドロップイン・リプレイスメントとして機能し、chat completions、messages、embeddings、audioのルートをサポートしています。
- 幅広いエコシステム対応: 11のエージェントCLI(Claude CodeやAiderを含む)および3つの主要なPythonフレームワークとのワイヤ検証済みの互換性を備えています。
- ハードウェア認識: ユーザーのMac構成に基づいて、特定のモデルサイズと量子化を推奨するRAM検出機能を搭載しています。