SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
它解决了什么问题
SwiftLM 是一个高性能推理服务器,专为在 Apple Silicon 上运行大型语言模型(LLMs)而设计,无需 Python 运行时或全局解释器锁(GIL)的开销。它利用原生 Swift 和 Metal,能够执行超大模型——包括那些超出物理内存容量的模型——并通过兼容 OpenAI 的 API 实现轻松集成。
它如何工作
该项目利用 MLX 框架,并编译为单个原生二进制文件。它采用多种先进优化技术,以最大化 Apple Silicon 的性能表现:
- TurboQuantization:一种混合 KV 缓存压缩架构,通过非线性 Lloyd-Max 编码表和融合的 Metal 着色器,将内存使用量减少约 3.5 倍。
- SSD 专家流式传输:专为混合专家(MoE)模型设计的流水线,可直接从 NVMe SSD 流式传输专家层到 GPU,使 Qwen3.5-397B 等模型在内存受限环境下也能运行。
- 推测性解码:使用小型草稿模型预测 token,再由大型主模型批量验证,从而提升吞吐量。
- 原生多模态支持:通过 Metal 和 AVFoundation,提供专用标志用于视觉(
--vision)和音频(--audio)处理。
适合谁使用
- Apple Silicon 用户:希望以最高效率在本地运行前沿开源权重模型。
- 开发者:需要一个即插即用的 OpenAI 兼容本地服务器来集成到自己的应用中。
- iOS 开发者:希望在设备上实现 MLX 推理(可通过附带的 SwiftBuddy 伴侣应用实现)。
主要亮点
- 100% 原生:无需 Python;为 macOS 和 iOS 编译为单个二进制文件。
- OpenAI 兼容:支持
/v1/chat/completions和流式传输。 - 支持超大模型:通过 SSD 流式传输,可运行 100B+ 参数的 MoE 模型。
- 广泛模型兼容性:支持多种模型系列,包括 Gemma 4、Qwen 3.5、Llama 3.3、DeepSeek V3 和 Phi 4。
- KV 缓存压缩:通过 TurboQuant 实现长上下文下的显著内存节省。
相关
- 项目
- 项目
- 项目
- 项目
- 项目