ddalcu/mlx-serve

Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.

解決する課題

macOS上で大規模言語モデルや生成AIを実行することは、リソースを大量に消費し、複雑になる場合があります。このプロジェクトは、PythonやElectronのオーバーヘッドなしに、Apple Silicon上でLLMおよびマルチモーダルモデル(画像、動画、音楽、音声、3D)を実行するための、高性能かつネイティブな方法を提供します。

仕組み

このプロジェクトは、MLXおよびGGUF(組み込みのllama.cpp経由)を含む複数のモデル形式をサポートするネイティブZigサーバーで構成されています。OpenAI、Anthropic、Ollama互換のAPIを公開しているため、Cursor、Claude Code、Open WebUIなどの既存のツールとシームレスに統合できます。また、モデル管理、チャット、エージェントワークフローにグラフィカルなインターフェースを好むユーザー向けに、MLX Coreと呼ばれるmacOSメニューバーアプリも含まれています。

対象ユーザー

  • アプリケーションに高速でローカル、かつPython不要の推論エンジンを求めている開発者
  • Macハードウェア上で多様なモデル(テキスト、画像、動画など)を実行するための高性能な方法を探しているAI愛好家
  • 互換APIを介して、既存のワークフロー内でローカルモデルを使用したいパワーユーザー

ハイライト

  • マルチモーダル対応: テキスト、画像、動画、音楽、音声(ボイスクローニング付き)、および3Dモデルを生成します。
  • 高いパフォーマンス: Speculative decoding、continuous batching、および高速なprefillingのためのカスタムMetalカーネルを搭載しています。
  • 幅広い互換性: MLXおよびGGUF形式をサポートし、OpenAI、Anthropic、Ollama互換のAPIを提供します。
  • 高度な機能: エージェントサンドボックス(隔離されたLinux VM)、LANモデル共有、およびKV-cache量子化が含まれます。
  • 依存関係ゼロのランタイム: Zigで構築されており、バイナリの実行にPythonのインストールを必要としません。