ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

何を解決するか

mlx-serve は Apple Silicon Mac 用の高性能でローカルの推論サーバーを提供し、Python やクラウド依存関係の必要性を排除します。ユーザーは自前のハードウェア上で、MLX および GGUF 形式の膨大な LLM とマルチモーダルモデル(画像、動画、音楽、音声、3D)を、統一された標準 API サーフェスで実行できます。

動作方法

ネイティブな Zig バイナリとして構築されたサーバーは、MLX と埋め込みられた llama.cpp(GGUF 対応)を統合しています。1 つのポート上で OpenAI、Anthropic、Ollama、および専用メディアエンドポイントの 4 つの互換 API サーフェスを公開します。Apple Silicon 上でのデコード速度を最大化するために、カスタム Metal カーネル、連続バッチ処理、および 4 種類の予測デコード(PLD、ドラフトコンパニオン、Gemma 4 ドラフト、Qwen MTP)を活用しています。

対象ユーザー

Apple Silicon Mac を使用し、Python や Electron アプリのオーバーヘッドなしに、Claude Code、Cursor、Open WebUI などの既存ツールとシームレスに統合できる高速なスタンドアロンローカル推論サーバーを求める開発者や AI ファン。

主な特徴

  • 統一されたモデル対応: MLX および GGUF モデルを実行可能。DeepSeek V4 Flash などの巨大アーキテクチャも対応。
  • マルチモーダル機能: 画像、動画、音楽、音声(ボイスクラーニング対応)、3D モデルのネイティブ生成。
  • 多様な API 互換性: OpenAI、Anthropic、Ollama API の即時置き換え可能。
  • 高パフォーマンス: 先進的な予測デコードと Metal カーネルにより、同じ重みで LM Studio より最大 26% の高速デコード速度。
  • MLX Core App: サイン済み macOS メニューバーアプリ。モデル管理、チャット、エージェントシェルコマンド用の隔離された Linux VM サンドボックスを提供。
  • LAN共有: Bonjour を介して、ローカルネットワーク上の複数の Mac でモデルを共有可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト