SharpAI/SwiftLM

⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.

它解决了什么问题

SwiftLM 是一个高性能推理服务器,专为在 Apple Silicon 上运行大型语言模型(LLMs)而设计,无需 Python 运行时或全局解释器锁(GIL)的开销。它利用原生 Swift 和 Metal,能够执行超大模型——包括那些超出物理内存容量的模型——并通过兼容 OpenAI 的 API 实现轻松集成。

它如何工作

该项目利用 MLX 框架,并编译为单个原生二进制文件。它采用多种先进优化技术,以最大化 Apple Silicon 的性能表现:

  • TurboQuantization:一种混合 KV 缓存压缩架构,通过非线性 Lloyd-Max 编码表和融合的 Metal 着色器,将内存使用量减少约 3.5 倍。
  • SSD 专家流式传输:专为混合专家(MoE)模型设计的流水线,可直接从 NVMe SSD 流式传输专家层到 GPU,使 Qwen3.5-397B 等模型在内存受限环境下也能运行。
  • 推测性解码:使用小型草稿模型预测 token,再由大型主模型批量验证,从而提升吞吐量。
  • 原生多模态支持:通过 Metal 和 AVFoundation,提供专用标志用于视觉(--vision)和音频(--audio)处理。

适合谁使用

  • Apple Silicon 用户:希望以最高效率在本地运行前沿开源权重模型。
  • 开发者:需要一个即插即用的 OpenAI 兼容本地服务器来集成到自己的应用中。
  • iOS 开发者:希望在设备上实现 MLX 推理(可通过附带的 SwiftBuddy 伴侣应用实现)。

主要亮点

  • 100% 原生:无需 Python;为 macOS 和 iOS 编译为单个二进制文件。
  • OpenAI 兼容:支持 /v1/chat/completions 和流式传输。
  • 支持超大模型:通过 SSD 流式传输,可运行 100B+ 参数的 MoE 模型。
  • 广泛模型兼容性:支持多种模型系列,包括 Gemma 4、Qwen 3.5、Llama 3.3、DeepSeek V3 和 Phi 4。
  • KV 缓存压缩:通过 TurboQuant 实现长上下文下的显著内存节省。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目