raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

Rapid‑MLX – Apple Silicon에서 빠르고 로컬 AI

무엇인가요 – Rapid‑MLX는 MLX 라이브러리를 사용하여 M-시리즈 맥에서 대규모 언어, 비전, 오디오 및 확산 모델을 네이티브로 실행하는 파이썬 기반 추론 엔진입니다. 명령줄 도구(rapid‑mlx)와 macOS 데스크톱 앱을 제공하며, 둘 다 OpenAI 호환 HTTP API(/v1/...)를 노출하여 OpenAI 또는 Anthropic에 연결하는 클라이언트(예: LangChain, Aider, Claude Code, Codex CLI)가 http://localhost:8000을 가리키고 완전히 오프라인으로 실행할 수 있습니다.


빠른 시작 (60초)

# 설치 (Homebrew, pip 또는 안내 설치 프로그램)
brew install rapid-mlx   # 또는 curl … | bash

# 터미널에서 대화하기 (첫 실행 시 4비트 4B 모델 다운로드)
rapid-mlx chat

# 또는 OpenAI 호환 서버 시작하기
rapid-mlx serve qwen3.5-4b-4bit

이제 curl 또는 어떤 OpenAI SDK로도 서버에 접근할 수 있습니다:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'

핵심 기능

카테고리 작동 방식 예시 모델
텍스트 생성 연속 배치 커널, 프롬프트 캐시, 양자화된 KV 캐시 (int4/int8) qwen3.5-4b-4bit, qwen3.6-35b-8bit
비전 / 이미지 생성 확산 파이프라인 (Flux, Stable Diffusion 등)은 /v1/images/*를 통해 접근 flux2-klein-4b, z-image-turbo
비디오 생성 텍스트 → 비디오 / 이미지 → 비디오 백엔드 (Wan, CogVideoX‑Fun, LTX) wan2.2-ti2v-5b-q8
오디오 TTS, 음성 인식, 음성 클로닝, 강제 정렬은 /v1/audio/*를 통해 kokoro, whisper-large-v3-turbo, indextts
임베딩 표준 OpenAI /v1/embeddings 엔드포인트 (동일한 텍스트 모델)
에이전트 통합 12개의 인기 있는 코딩/보조 CLI용 사전 검증된 어댑터 (Claude Code, Codex CLI, Aider 등)

설치 옵션

방법 제공되는 기능
Homebrew (brew install rapid-mlx) 사전 빌드된 바이너리, rapid-mlx CLI를 PATH에 추가
안내 설치 프로그램 (`curl … bash`)
pip/uv (pip install rapid-mlx) 순수 파이썬 설치; 패키지를 검사하거나 수정 가능
데스크톱 앱 (rapidmlx.com에서 다운로드) 한 번의 클릭으로 GUI를 제공하며 동일한 엔진과 모델 관리자 포함

OpenAI/Anthropic 백엔드로 즉시 사용하기

  • 엔드포인트http://localhost:8000/v1 (OpenAI) 또는 http://localhost:8000 (Anthropic /v1/messages)
  • 인증 – 로컬 사용 시 API 키가 필요 없음; 공개적으로 서버를 노출할 경우 RAPID_MLX_API_KEY를 설정할 수 있음
  • 지원되는 경로chat/completions, responses (Codex), messages (Claude), embeddings, images/generations, images/edits, videos, audio/*
  • 클라이언트 호환성 – LangChain, Pydantic‑AI, OpenCode, Aider, Claude Code, 그리고 로컬 OpenAI 호환 엔드포인트에 연결할 수 있는 다른 도구와 호환됨

에이전트 지원

Rapid‑MLX는 12개의 코딩 에이전트용 와이어 검증 어댑터를 제공합니다. 다섯 개는 티어 1 (Claude Code, Codex CLI, Hermes, Aider, DeepSeek Harness)로, 매 릴리스마다 실제 모델 가중치에 대해 재테스트됩니다. 나머지 에이전트(OpenCode, Qwen Code, OpenHands, Kilo Code, GitHub Copilot, Factory Droid, Moonshot Kimi Code)는 티어 2이며, 약간 덜 강한 테스트 세트로 검증됩니다.

단일 명령어로 에이전트를 자동 구성할 수 있습니다. 예를 들어:

rapid-mlx launch claude-code   # Claude Code를 로컬 서버 사용하도록 패치

성능 요약 (README에 기재된 내용)

  • 동일한 하드웨어에서 Ollama보다 최대 3배 높은 처리량 (벤치마크 링크 제공)
  • M3 Ultra에서 flux2-klein-4b로 이미지 생성 시 1024×1024 이미지당 약 9초 소요
  • 비디오 생성은 한 번에 하나의 클립만 실행 가능; Wan 2.2 모델로 1초 클립 생성에는 수분의 계산 시간 소요
  • 양자화된 KV 캐시와 연속 배치로 메모리 사용량을 낮게 유지하여 16GB~32GB 통합 메모리가 있는 맥에서 35B 모델도 실행 가능

제한 사항 / 주의사항

  • Apple Silicon 전용 – 엔진은 M1~M4에서 실행되는 MLX 커널에 의존하며, Windows 또는 Linux 바이너리는 제공되지 않음
  • 단일 비행 생성 – 확산 파이프라인(이미지, 비디오)은 직렬화됨; 통합 메모리 제약으로 인해 두 개의 생성을 동시에 실행할 수 없음
  • 모델 라이선스 – Rapid‑MLX는 기반 모델을 재라이선스하지 않음; 상용 사용 전 각 모델의 원래 조건을 준수해야 함
  • 공개 노출 – 서버를 인터넷에 터널링할 경우 RAPID_MLX_API_KEY를 설정해야 함; 그렇지 않으면 엔드포인트는 인증 없이 로컬에서만 사용해야 함
  • 파이썬 버전 – 핵심 텍스트/오디오 기능은 파이썬 3.10+에서 작동하지만, 비디오 런타임은 파이썬 3.11+ 필요

다음 단계


결론 – Rapid‑MLX는 Apple Silicon 맥에서 프로덕션 수준의 로컬 추론 스택으로, OpenAI/Anthropic API를 모방하여 채팅, 코딩 보조기, 이미지/비디오 생성, 오디오 작업에 대해 빠르고 개인 정보 보호가 보장되는 오프라인 추론을 쉽게 가능하게 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트