jundot/omlx
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
解决的问题
oMLX 是一个专为 Apple Silicon Mac 优化的高性能 LLM 推理服务器。它解决了便利性与控制权之间的权衡,提供了一个管理环境,用户可以将模型固定在内存中,按需自动交换大型模型,并通过原生 macOS 菜单栏应用管理整个服务器。
工作原理
该项目采用受 vLLM 启发的分层 KV(键值)缓存系统,将存储分为“热”内存层(用于快速访问)和“冷”SSD 层(用于在重启或上下文变更后持久化上下文)。它通过 mlx-lm 实现连续批处理,以处理并发请求,并提供与 OpenAI/Anthropic 兼容的 API,便于与外部工具集成。对于高级用户,还支持实验性的多 Mac 推理,允许通过 Ring 或 Thunderbolt RDMA 的流水线等级将单个模型拆分到多个 Mac 上运行。
适用人群
希望在 macOS 上以专业级内存管理和高吞吐量运行本地 LLM、VLM 和嵌入模型的开发者和高级用户,特别是使用 Claude Code 等代码助手的用户。
主要亮点
- 分层 KV 缓存:在 RAM 和 SSD 之间持久化对话上下文,避免重复计算提示。
- 原生 macOS 集成:包含基于 Swift 的菜单栏应用,用于监控和服务器控制,无需使用终端。
- 多模型服务:支持同时加载 LLM、VLM、OCR 模型和重排序器,具备 LRU 淘汰机制和模型固定功能。
- 管理仪表板:全面的 Web UI,支持从 HuggingFace 下载模型、基准测试和单个模型配置。
- API 兼容性:可作为 OpenAI 和 Anthropic API 的即插即用替代品,支持工具调用和 MCP(模型上下文协议)集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目