ddalcu/mlx-serve
Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.
何を解決するか
mlx-serve は Apple Silicon Mac 用の高性能でローカルの推論サーバーを提供し、Python やクラウド依存関係の必要性を排除します。ユーザーは自前のハードウェア上で、MLX および GGUF 形式の膨大な LLM とマルチモーダルモデル(画像、動画、音楽、音声、3D)を、統一された標準 API サーフェスで実行できます。
動作方法
ネイティブな Zig バイナリとして構築されたサーバーは、MLX と埋め込みられた llama.cpp(GGUF 対応)を統合しています。1 つのポート上で OpenAI、Anthropic、Ollama、および専用メディアエンドポイントの 4 つの互換 API サーフェスを公開します。Apple Silicon 上でのデコード速度を最大化するために、カスタム Metal カーネル、連続バッチ処理、および 4 種類の予測デコード(PLD、ドラフトコンパニオン、Gemma 4 ドラフト、Qwen MTP)を活用しています。
対象ユーザー
Apple Silicon Mac を使用し、Python や Electron アプリのオーバーヘッドなしに、Claude Code、Cursor、Open WebUI などの既存ツールとシームレスに統合できる高速なスタンドアロンローカル推論サーバーを求める開発者や AI ファン。
主な特徴
- 統一されたモデル対応: MLX および GGUF モデルを実行可能。DeepSeek V4 Flash などの巨大アーキテクチャも対応。
- マルチモーダル機能: 画像、動画、音楽、音声(ボイスクラーニング対応)、3D モデルのネイティブ生成。
- 多様な API 互換性: OpenAI、Anthropic、Ollama API の即時置き換え可能。
- 高パフォーマンス: 先進的な予測デコードと Metal カーネルにより、同じ重みで LM Studio より最大 26% の高速デコード速度。
- MLX Core App: サイン済み macOS メニューバーアプリ。モデル管理、チャット、エージェントシェルコマンド用の隔離された Linux VM サンドボックスを提供。
- LAN共有: Bonjour を介して、ローカルネットワーク上の複数の Mac でモデルを共有可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト