ddalcu/mlx-serve
Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling.
解決する課題
macOS上で大規模言語モデルや生成AIを実行することは、リソースを大量に消費し、複雑になる場合があります。このプロジェクトは、PythonやElectronのオーバーヘッドなしに、Apple Silicon上でLLMおよびマルチモーダルモデル(画像、動画、音楽、音声、3D)を実行するための、高性能かつネイティブな方法を提供します。
仕組み
このプロジェクトは、MLXおよびGGUF(組み込みのllama.cpp経由)を含む複数のモデル形式をサポートするネイティブZigサーバーで構成されています。OpenAI、Anthropic、Ollama互換のAPIを公開しているため、Cursor、Claude Code、Open WebUIなどの既存のツールとシームレスに統合できます。また、モデル管理、チャット、エージェントワークフローにグラフィカルなインターフェースを好むユーザー向けに、MLX Coreと呼ばれるmacOSメニューバーアプリも含まれています。
対象ユーザー
- アプリケーションに高速でローカル、かつPython不要の推論エンジンを求めている開発者。
- Macハードウェア上で多様なモデル(テキスト、画像、動画など)を実行するための高性能な方法を探しているAI愛好家。
- 互換APIを介して、既存のワークフロー内でローカルモデルを使用したいパワーユーザー。
ハイライト
- マルチモーダル対応: テキスト、画像、動画、音楽、音声(ボイスクローニング付き)、および3Dモデルを生成します。
- 高いパフォーマンス: Speculative decoding、continuous batching、および高速なprefillingのためのカスタムMetalカーネルを搭載しています。
- 幅広い互換性: MLXおよびGGUF形式をサポートし、OpenAI、Anthropic、Ollama互換のAPIを提供します。
- 高度な機能: エージェントサンドボックス(隔離されたLinux VM)、LANモデル共有、およびKV-cache量子化が含まれます。
- 依存関係ゼロのランタイム: Zigで構築されており、バイナリの実行にPythonのインストールを必要としません。