jundot/omlx
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
解決的問題
oMLX 是專為 Apple Silicon Mac 優化的高效率 LLM 推論伺服器。它解決了便利性與控制之間的權衡,提供一個管理環境,讓使用者能將模型固定在記憶體中,按需求自動交換大型模型,並透過原生 macOS 菜單列應用程式管理整個伺服器。
工作原理
本專案採用受 vLLM 啟發的階層式 KV(鍵值)快取系統,將儲存空間分為「熱」記憶體層(用於快速存取)與「冷」SSD 層(用於在重啟或上下文變更後持續保留上下文)。透過 mlx-lm 實現連續批次處理,以處理並行請求,並提供與 OpenAI/Anthropic 相容的 API,方便與外部工具整合。針對進階使用者,支援實驗性多 Mac 推論,允許透過 Ring 或 Thunderbolt RDMA 的流水線等級,將單一模型拆分至多台 Mac 上執行。
適用對象
希望在 macOS 上以專業級記憶體管理與高吞吐量運行本地 LLM、VLM 及嵌入模型的開發者與高階使用者,特別是使用 Claude Code 等程式助手的使用者。
主要特色
- 階層式 KV 快取:在 RAM 與 SSD 之間持續保留對話上下文,避免重複計算提示。
- 原生 macOS 整合:內建 Swift 編寫的菜單列應用程式,可無需終端機進行監控與伺服器控制。
- 多模型服務:支援同時載入 LLM、VLM、OCR 模型與重排序器,具備 LRU 淘汰機制與模型固定功能。
- 管理儀表板:全面的 Web UI,支援從 HuggingFace 下載模型、基準測試與單一模型設定。
- API 相容性:可作為 OpenAI 與 Anthropic API 的即插即用替代品,支援工具呼叫與 MCP(模型上下文協定)整合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案