SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
What it solves
SwiftLM 是一個高效能推論伺服器,專為 Apple Silicon 設計。它消除 Python 執行環境與全域直譯器鎖 (GIL) 的開銷,讓使用者能在 macOS 與 iOS 上以裸金屬效能執行大型語言模型 (LLM)、視覺語言模型 (VLM) 與音訊語言模型 (ALM)。
How it works
SwiftLM 以原生 Swift 與 Metal 建置,透過 OpenAI 相容的 API 服務 MLX 模型。它採用多項先進最佳化技術,讓巨型模型在受限硬體上得以運作:
- SSD Expert Streaming:對於混合專家 (MoE) 模型,直接從 NVMe SSD 串流專家權重至 GPU,使得如 Qwen3.5-397B 之類的模型能在僅 64GB 記憶體的機器上執行。
- TurboQuantization:一種混合 KV 快取壓縮架構,較 FP16 減少約 3.5 倍記憶體使用,且只帶來極小的精度損失,使用非線性 Lloyd‑Max 代碼本,於融合的 Metal 著色器中處理。
- Speculative Decoding:使用小型草稿模型預測 token,然後由較大的主模型批次驗證,加速記憶體內推論。
- Native Multimodal Support:提供視覺 (
--vision) 與音訊 (--audio) 處理的專屬旗標,支援即時影像解析與透過 AVFoundation 的音訊輸入。
Who it’s for
- Apple Silicon 使用者:想在 Mac 或 iPhone/iPad 上取得最快本地 LLM 推論的開發者與研究者。
- 記憶體受限使用者:需要在消費級 Apple 硬體上執行前沿規模 MoE 模型(100B+ 參數)的使用者。
- iOS 開發者:希望透過隨附的 SwiftBuddy companion app,將 MLX 推論整合至行動應用的開發者。
Highlights
- OpenAI-Compatible:可直接取代 OpenAI SDK。
- 100% Native:不需要 Python;編譯為單一二進位檔。
- Massive MoE Support:SSD 串流可為過大模型提供最高 10 倍的加速。
- KV Cache Compression:TurboQuant 讓 24GB 記憶體機器可處理 100k 上下文視窗。
- Multimodal:原生支援 VLM(例如 Qwen2-VL)與 ALM(例如 Gemma 4 Omni)。