ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

해결하는 문제

macOS에서 대규모 언어 모델(LLM) 및 생성형 AI를 실행하는 것은 리소스를 많이 소모하고 복잡할 수 있습니다. 이 프로젝트는 Python이나 Electron의 오버헤드 없이 Apple Silicon에서 LLM 및 멀티모달 모델(이미지, 비디오, 음악, 음성 및 3D)을 실행할 수 있는 고성능 네이티브 방식을 제공합니다.

작동 원리

이 프로젝트는 MLX 및 GGUF(내장된 llama.cpp를 통해)를 포함한 다양한 모델 형식을 지원하는 네이티브 Zig 서버로 구성됩니다. OpenAI, Anthropic 및 Ollama 호환 API를 노출하여 Cursor, Claude Code, Open WebUI와 같은 기존 도구와 원활하게 통합할 수 있습니다. 또한 모델 관리, 채팅 및 에이전트 워크플로우를 위한 그래픽 인터페이스를 선호하는 사용자를 위해 MLX Core라는 macOS 메뉴 바 앱도 포함되어 있습니다.

대상 사용자

  • 애플리케이션을 위한 빠르고 로컬이며 Python이 필요 없는 추론 엔진을 원하는 개발자.
  • Mac 하드웨어에서 다양한 모델(텍스트, 이미지, 비디오 등)을 실행할 수 있는 고성능 방법을 찾는 AI 애호가.
  • 호환되는 API를 통해 기존 워크플로우 내에서 로컬 모델을 사용하고자 하는 파워 유저.

주요 특징

  • 멀티모달 지원: 텍스트, 이미지, 비디오, 음악, 음성(음성 복제 포함) 및 3D 모델을 생성합니다.
  • 고성능: Speculative decoding, continuous batching 및 빠른 prefilling을 위한 커스텀 Metal 커널을 특징으로 합니다.
  • 폭넓은 호환성: MLX 및 GGUF 형식을 지원하며 OpenAI, Anthropic 및 Ollama 호환 API를 제공합니다.
  • 고급 기능: 에이전트 샌드박스(격리된 Linux VM), LAN 모델 공유 및 KV-cache 양자화를 포함합니다。
  • 제로 종속성 런타임: Zig으로 구축되어 바이너리 실행을 위해 Python 설치가 필요하지 않습니다.