jundot/omlx

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

何を解決するか

oMLX は Apple Silicon Mac に特化して最適化された高性能 LLM 推論サーバーです。便利さと制御のトレードオフを解消し、ユーザーがモデルをメモリにピン止めしたり、必要に応じて重いモデルを自動でスワップしたり、ネイティブ macOS メニューバー アプリからサーバー全体を管理できる管理環境を提供します。

動作方法

このプロジェクトは、vLLM からインスパイアされた階層型 KV(キー・バリュー)キャッシュシステムを使用しています。これは、高速アクセス用の「ホット」RAM タイアと、再起動やコンテキスト変更後もコンテキストを永続化するための「コールド」SSD タイアにストレージを分割します。mlx-lm を用いた連続バッチ処理により、並行リクエストを処理し、外部ツールとの統合を容易にする OpenAI/Anthropic 互換 API を提供します。高度なユーザー向けには、リングまたは Thunderbolt RDMA を介したパイプラインランクを使って、1 つのモデルを複数の Mac に分割して推論する実験的マルチマシン推論もサポートしています。

対象ユーザー

コードアシスタント(例:Claude Code)など、ローカル LLM、VLM、埋め込みモデルをプロフェッショナルなメモリ管理と高スループットで実行したい macOS ユーザー、開発者、パワーユーザー。

主な特徴

  • 階層型 KV キャッシュ: RAM と SSD の間で会話コンテキストを永続化し、プロンプトの再計算を回避します。
  • ネイティブ macOS 統合: Swift で作成されたメニューバー アプリにより、ターミナルを使わずに監視とサーバー制御が可能になります。
  • マルチモデルサービング: LLM、VLM、OCR モデル、リランカーを同時にロードでき、LRU 置換とモデルピン止めをサポートします。
  • 管理者ダッシュボード: HuggingFace からのモデルダウンロード、ベンチマーク、各モデルの設定を可能にする包括的な Web UI。
  • API 互換性: OpenAI および Anthropic API のドロップインリプレースであり、ツールコールや MCP(Model Context Protocol)統合もサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト