jundot/omlx

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

解决的问题

oMLX 是一个专为 Apple Silicon Mac 优化的高性能 LLM 推理服务器。它解决了便利性与控制权之间的权衡,提供了一个管理环境,用户可以将模型固定在内存中,按需自动交换大型模型,并通过原生 macOS 菜单栏应用管理整个服务器。

工作原理

该项目采用受 vLLM 启发的分层 KV(键值)缓存系统,将存储分为“热”内存层(用于快速访问)和“冷”SSD 层(用于在重启或上下文变更后持久化上下文)。它通过 mlx-lm 实现连续批处理,以处理并发请求,并提供与 OpenAI/Anthropic 兼容的 API,便于与外部工具集成。对于高级用户,还支持实验性的多 Mac 推理,允许通过 Ring 或 Thunderbolt RDMA 的流水线等级将单个模型拆分到多个 Mac 上运行。

适用人群

希望在 macOS 上以专业级内存管理和高吞吐量运行本地 LLM、VLM 和嵌入模型的开发者和高级用户,特别是使用 Claude Code 等代码助手的用户。

主要亮点

  • 分层 KV 缓存:在 RAM 和 SSD 之间持久化对话上下文,避免重复计算提示。
  • 原生 macOS 集成:包含基于 Swift 的菜单栏应用,用于监控和服务器控制,无需使用终端。
  • 多模型服务:支持同时加载 LLM、VLM、OCR 模型和重排序器,具备 LRU 淘汰机制和模型固定功能。
  • 管理仪表板:全面的 Web UI,支持从 HuggingFace 下载模型、基准测试和单个模型配置。
  • API 兼容性:可作为 OpenAI 和 Anthropic API 的即插即用替代品,支持工具调用和 MCP(模型上下文协议)集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目