ddalcu/mlx-serve
Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.
해결하는 문제
mlx-serve는 Apple Silicon 맥을 위한 고성능 로컬 추론 서버를 제공하여 Python 또는 클라우드 종속성을 제거합니다. 사용자는 자체 하드웨어에서 MLX 및 GGUF 형식의 방대한 LLM과 멀티모달 모델(이미지, 동영상, 음악, 음성, 3D)을 통합된 표준 API 표면을 통해 실행할 수 있습니다.
작동 방식
네이티브 Zig 바이너리로 구축된 서버는 MLX와 GGUF 지원을 위한 내장된 llama.cpp를 통합합니다. 단일 포트에서 OpenAI, Anthropic, Ollama 및 전용 미디어 엔드포인트의 네 가지 호환 API 표면을 노출합니다. Apple Silicon에서 디코딩 속도를 극대화하기 위해 사용자 정의 Metal 커널, 연속 배치 처리, 그리고 네 가지 유형의 사전 추론(PLD, 드래프트 동반자, Gemma 4 드래프터, Qwen MTP)을 활용합니다.
대상 사용자
Apple Silicon 맥을 사용하고 있으며, Python 또는 Electron 앱의 오버헤드 없이 Claude Code, Cursor, Open WebUI와 같은 기존 도구와 원활하게 통합되는 빠르고 독립적인 로컬 추론 서버를 원하는 개발자 및 AI 애호가.
주요 특징
- 통합 모델 지원: MLX 및 GGUF 모델을 실행 가능하며, DeepSeek V4 Flash와 같은 거대한 아키텍처도 지원.
- 멀티모달 기능: 이미지, 동영상, 음악, 음성(보이스 클로닝 포함), 3D 모델의 네이티브 생성.
- 다중 API 호환성: OpenAI, Anthropic, Ollama API의 즉시 대체 가능.
- 고성능: 고급 사전 추론과 Metal 커널을 통해 동일한 가중치 기준으로 LM Studio보다 최대 26% 더 빠른 디코딩 속도.
- MLX Core App: 서명된 macOS 메뉴바 앱으로 모델 관리, 채팅, 에이전트 쉘 명령어용 격리된 Linux VM 사전 환경 제공.
- LAN 공유: Bonjour를 통해 로컬 네트워크 상의 여러 맥 간에 모델 공유 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트