jundot/omlx
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
何を解決するか
oMLX は Apple Silicon Mac に特化して最適化された高性能 LLM 推論サーバーです。便利さと制御のトレードオフを解消し、ユーザーがモデルをメモリにピン止めしたり、必要に応じて重いモデルを自動でスワップしたり、ネイティブ macOS メニューバー アプリからサーバー全体を管理できる管理環境を提供します。
動作方法
このプロジェクトは、vLLM からインスパイアされた階層型 KV(キー・バリュー)キャッシュシステムを使用しています。これは、高速アクセス用の「ホット」RAM タイアと、再起動やコンテキスト変更後もコンテキストを永続化するための「コールド」SSD タイアにストレージを分割します。mlx-lm を用いた連続バッチ処理により、並行リクエストを処理し、外部ツールとの統合を容易にする OpenAI/Anthropic 互換 API を提供します。高度なユーザー向けには、リングまたは Thunderbolt RDMA を介したパイプラインランクを使って、1 つのモデルを複数の Mac に分割して推論する実験的マルチマシン推論もサポートしています。
対象ユーザー
コードアシスタント(例:Claude Code)など、ローカル LLM、VLM、埋め込みモデルをプロフェッショナルなメモリ管理と高スループットで実行したい macOS ユーザー、開発者、パワーユーザー。
主な特徴
- 階層型 KV キャッシュ: RAM と SSD の間で会話コンテキストを永続化し、プロンプトの再計算を回避します。
- ネイティブ macOS 統合: Swift で作成されたメニューバー アプリにより、ターミナルを使わずに監視とサーバー制御が可能になります。
- マルチモデルサービング: LLM、VLM、OCR モデル、リランカーを同時にロードでき、LRU 置換とモデルピン止めをサポートします。
- 管理者ダッシュボード: HuggingFace からのモデルダウンロード、ベンチマーク、各モデルの設定を可能にする包括的な Web UI。
- API 互換性: OpenAI および Anthropic API のドロップインリプレースであり、ツールコールや MCP(Model Context Protocol)統合もサポートしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト