SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
What it solves
SwiftLM 是一个高性能推理服务器,专为 Apple Silicon 设计。它消除 Python 运行时和全局解释器锁 (GIL) 的开销,让用户能够在 macOS 和 iOS 上以裸金属性能运行大型语言模型 (LLM)、视觉语言模型 (VLM) 和音频语言模型 (ALM)。
How it works
SwiftLM 使用原生 Swift 与 Metal 构建,通过 OpenAI 兼容的 API 服务 MLX 模型。它采用多种先进的优化技术,以在受限硬件上处理巨型模型:
- SSD Expert Streaming:对于混合专家 (MoE) 模型,直接从 NVMe SSD 将专家权重流式传输到 GPU,使得如 Qwen3.5-397B 之类的模型能够在仅 64GB RAM 的机器上运行。
- TurboQuantization:一种混合 KV 缓存压缩架构,相比 FP16 可减少约 3.5 倍的内存使用,且精度损失极小,使用非线性 Lloyd‑Max 码本,在融合的 Metal 着色器中处理。
- Speculative Decoding:使用小型草稿模型预测 token,然后由更大的主模型批量验证,加速内存中的推理。
- Native Multimodal Support:提供视觉 (
--vision) 与音频 (--audio) 处理的专用标志,支持实时图像解析和通过 AVFoundation 的音频输入。
Who it’s for
- Apple Silicon 用户:希望在 Mac 或 iPhone/iPad 上获得最快本地 LLM 推理的开发者和研究者。
- 内存受限用户:需要在消费级 Apple 硬件上运行前沿规模 MoE 模型(100B+ 参数)的用户。
- iOS 开发者:希望通过随附的 SwiftBuddy companion app 将 MLX 推理集成到移动应用中的开发者。
Highlights
- OpenAI-Compatible:可直接替代 OpenAI SDK。
- 100% Native:无需 Python;编译为单一二进制文件。
- Massive MoE Support:SSD 流式传输为超大模型提供最高 10 倍的加速。
- KV Cache Compression:TurboQuant 让 24GB RAM 机器可处理 100k 上下文窗口。
- Multimodal:原生支持 VLM(例如 Qwen2-VL)和 ALM(例如 Gemma 4 Omni)。