raullenchai/Rapid-MLX
The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.
Rapid‑MLX – Apple Silicon에서 빠르고 로컬 AI
무엇인가요 – Rapid‑MLX는 MLX 라이브러리를 사용하여 M-시리즈 맥에서 대규모 언어, 비전, 오디오 및 확산 모델을 네이티브로 실행하는 파이썬 기반 추론 엔진입니다. 명령줄 도구(rapid‑mlx)와 macOS 데스크톱 앱을 제공하며, 둘 다 OpenAI 호환 HTTP API(/v1/...)를 노출하여 OpenAI 또는 Anthropic에 연결하는 클라이언트(예: LangChain, Aider, Claude Code, Codex CLI)가 http://localhost:8000을 가리키고 완전히 오프라인으로 실행할 수 있습니다.
빠른 시작 (60초)
# 설치 (Homebrew, pip 또는 안내 설치 프로그램)
brew install rapid-mlx # 또는 curl … | bash
# 터미널에서 대화하기 (첫 실행 시 4비트 4B 모델 다운로드)
rapid-mlx chat
# 또는 OpenAI 호환 서버 시작하기
rapid-mlx serve qwen3.5-4b-4bit
이제 curl 또는 어떤 OpenAI SDK로도 서버에 접근할 수 있습니다:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"default","messages":[{"role":"user","content":"Say hello"}]}'
핵심 기능
| 카테고리 | 작동 방식 | 예시 모델 |
|---|---|---|
| 텍스트 생성 | 연속 배치 커널, 프롬프트 캐시, 양자화된 KV 캐시 (int4/int8) | qwen3.5-4b-4bit, qwen3.6-35b-8bit |
| 비전 / 이미지 생성 | 확산 파이프라인 (Flux, Stable Diffusion 등)은 /v1/images/*를 통해 접근 |
flux2-klein-4b, z-image-turbo |
| 비디오 생성 | 텍스트 → 비디오 / 이미지 → 비디오 백엔드 (Wan, CogVideoX‑Fun, LTX) | wan2.2-ti2v-5b-q8 |
| 오디오 | TTS, 음성 인식, 음성 클로닝, 강제 정렬은 /v1/audio/*를 통해 |
kokoro, whisper-large-v3-turbo, indextts |
| 임베딩 | 표준 OpenAI /v1/embeddings 엔드포인트 |
(동일한 텍스트 모델) |
| 에이전트 통합 | 12개의 인기 있는 코딩/보조 CLI용 사전 검증된 어댑터 (Claude Code, Codex CLI, Aider 등) | – |
설치 옵션
| 방법 | 제공되는 기능 |
|---|---|
Homebrew (brew install rapid-mlx) |
사전 빌드된 바이너리, rapid-mlx CLI를 PATH에 추가 |
| 안내 설치 프로그램 (`curl … | bash`) |
pip/uv (pip install rapid-mlx) |
순수 파이썬 설치; 패키지를 검사하거나 수정 가능 |
| 데스크톱 앱 (rapidmlx.com에서 다운로드) | 한 번의 클릭으로 GUI를 제공하며 동일한 엔진과 모델 관리자 포함 |
OpenAI/Anthropic 백엔드로 즉시 사용하기
- 엔드포인트 –
http://localhost:8000/v1(OpenAI) 또는http://localhost:8000(Anthropic/v1/messages) - 인증 – 로컬 사용 시 API 키가 필요 없음; 공개적으로 서버를 노출할 경우
RAPID_MLX_API_KEY를 설정할 수 있음 - 지원되는 경로 –
chat/completions,responses(Codex),messages(Claude),embeddings,images/generations,images/edits,videos,audio/* - 클라이언트 호환성 – LangChain, Pydantic‑AI, OpenCode, Aider, Claude Code, 그리고 로컬 OpenAI 호환 엔드포인트에 연결할 수 있는 다른 도구와 호환됨
에이전트 지원
Rapid‑MLX는 12개의 코딩 에이전트용 와이어 검증 어댑터를 제공합니다. 다섯 개는 티어 1 (Claude Code, Codex CLI, Hermes, Aider, DeepSeek Harness)로, 매 릴리스마다 실제 모델 가중치에 대해 재테스트됩니다. 나머지 에이전트(OpenCode, Qwen Code, OpenHands, Kilo Code, GitHub Copilot, Factory Droid, Moonshot Kimi Code)는 티어 2이며, 약간 덜 강한 테스트 세트로 검증됩니다.
단일 명령어로 에이전트를 자동 구성할 수 있습니다. 예를 들어:
rapid-mlx launch claude-code # Claude Code를 로컬 서버 사용하도록 패치
성능 요약 (README에 기재된 내용)
- 동일한 하드웨어에서 Ollama보다 최대 3배 높은 처리량 (벤치마크 링크 제공)
- M3 Ultra에서
flux2-klein-4b로 이미지 생성 시 1024×1024 이미지당 약 9초 소요 - 비디오 생성은 한 번에 하나의 클립만 실행 가능; Wan 2.2 모델로 1초 클립 생성에는 수분의 계산 시간 소요
- 양자화된 KV 캐시와 연속 배치로 메모리 사용량을 낮게 유지하여 16GB~32GB 통합 메모리가 있는 맥에서 35B 모델도 실행 가능
제한 사항 / 주의사항
- Apple Silicon 전용 – 엔진은 M1~M4에서 실행되는 MLX 커널에 의존하며, Windows 또는 Linux 바이너리는 제공되지 않음
- 단일 비행 생성 – 확산 파이프라인(이미지, 비디오)은 직렬화됨; 통합 메모리 제약으로 인해 두 개의 생성을 동시에 실행할 수 없음
- 모델 라이선스 – Rapid‑MLX는 기반 모델을 재라이선스하지 않음; 상용 사용 전 각 모델의 원래 조건을 준수해야 함
- 공개 노출 – 서버를 인터넷에 터널링할 경우
RAPID_MLX_API_KEY를 설정해야 함; 그렇지 않으면 엔드포인트는 인증 없이 로컬에서만 사용해야 함 - 파이썬 버전 – 핵심 텍스트/오디오 기능은 파이썬 3.10+에서 작동하지만, 비디오 런타임은 파이썬 3.11+ 필요
다음 단계
- 문서 – https://rapidmlx.com/docs/ (전체 API 참조, 모델 카탈로그, 벤치마크 방법론)
- 모델 미러 – https://models.rapidmlx.com/ (미리 캐시된 가중치 다운로드)
- 데스크톱 앱 – https://rapidmlx.com/desktop 로 GUI 경험 제공
- 커뮤니티 – 도움, 모델 추천, 릴리스 공지 등을 위한 디스코드 서버 (README에 링크)
결론 – Rapid‑MLX는 Apple Silicon 맥에서 프로덕션 수준의 로컬 추론 스택으로, OpenAI/Anthropic API를 모방하여 채팅, 코딩 보조기, 이미지/비디오 생성, 오디오 작업에 대해 빠르고 개인 정보 보호가 보장되는 오프라인 추론을 쉽게 가능하게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트