jundot/omlx

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

解決的問題

oMLX 是專為 Apple Silicon Mac 優化的高效率 LLM 推論伺服器。它解決了便利性與控制之間的權衡,提供一個管理環境,讓使用者能將模型固定在記憶體中,按需求自動交換大型模型,並透過原生 macOS 菜單列應用程式管理整個伺服器。

工作原理

本專案採用受 vLLM 啟發的階層式 KV(鍵值)快取系統,將儲存空間分為「熱」記憶體層(用於快速存取)與「冷」SSD 層(用於在重啟或上下文變更後持續保留上下文)。透過 mlx-lm 實現連續批次處理,以處理並行請求,並提供與 OpenAI/Anthropic 相容的 API,方便與外部工具整合。針對進階使用者,支援實驗性多 Mac 推論,允許透過 Ring 或 Thunderbolt RDMA 的流水線等級,將單一模型拆分至多台 Mac 上執行。

適用對象

希望在 macOS 上以專業級記憶體管理與高吞吐量運行本地 LLM、VLM 及嵌入模型的開發者與高階使用者,特別是使用 Claude Code 等程式助手的使用者。

主要特色

  • 階層式 KV 快取:在 RAM 與 SSD 之間持續保留對話上下文,避免重複計算提示。
  • 原生 macOS 整合:內建 Swift 編寫的菜單列應用程式,可無需終端機進行監控與伺服器控制。
  • 多模型服務:支援同時載入 LLM、VLM、OCR 模型與重排序器,具備 LRU 淘汰機制與模型固定功能。
  • 管理儀表板:全面的 Web UI,支援從 HuggingFace 下載模型、基準測試與單一模型設定。
  • API 相容性:可作為 OpenAI 與 Anthropic API 的即插即用替代品,支援工具呼叫與 MCP(模型上下文協定)整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案