raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

해결하는 문제

Rapid-MLX는 Apple Silicon(M1부터 M4 칩까지)에 특별히 최적화된 고성능 로컬 AI 엔진을 제공합니다. 표준 OpenAI 및 Anthropic API 형식을 유지하면서 Ollama와 같은 대안보다 훨씬 빠른 네이티브 MLX 기반 환경을 제공하여 복잡한 설정이나 서드파티 심(shim)의 필요성을 제거합니다.

작동 원리

이 엔진은 순수 MLX 커널을 사용하여 Apple Silicon의 하드웨어 대역폭을 활용합니다. 연속 배칭(continuous batching), 프롬프트 캐시(radix 및 DeltaNet RNN 스냅샷 사용), 양자화된 라이브 KV 캐시를 포함한 여러 성능 최적화를 구현합니다. 직접 채팅을 위한 명령줄 인터페이스(CLI) 또는 OpenAI/Anthropic API를 모방하는 HTTP 서버로 배포할 수 있어 다양한 IDE 및 에이전트 프레임워크의 백엔드로 사용할 수 있습니다.

대상 사용자

M 시리즈 Mac을 사용하여 LLM을 최대 효율로 로컬에서 실행하고자 하는 개발자 및 AI 애호가뿐만 아니라, AI 에이전트, 코딩 어시스턴트(Cursor 또는 Aider와 같은), Python 프레임워크(LangChain 또는 PydanticAI와 같은)를 위한 로컬 API 백엔드가 필요한 사용자들을 위해 설계되었습니다.

주요 특징

  • Apple Silicon 네이티브: llama.cpp 폴백이나 Metal 심 없이 순수 MLX 커널을 기반으로 구축되었습니다.
  • API 호환성: OpenAI 및 Anthropic API를 즉시 대체할 수 있으며, chat completions, messages, embeddings, audio 라우트를 지원합니다.
  • 광범위한 생태계 지원: 11개의 에이전트 CLI(Claude Code 및 Aider 포함)와 3개의 주요 Python 프레임워크에 대해 와이어 검증된 호환성을 제공합니다.
  • 하드웨어 인식: 사용자의 Mac 구성에 따라 특정 모델 크기와 양자화를 권장하는 RAM 탐지 기능이 포함되어 있습니다.