SharpAI/SwiftLM

⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.

What it solves

SwiftLM 是一款高效能推理伺服器,專為在 Apple Silicon 上執行大型語言模型 (LLMs) 而設計,且無需 Python 執行環境或全域解釋器鎖 (GIL) 的額外開銷。透過使用原生 Swift 和 Metal,它能夠執行龐大的模型——包括那些超過實體 RAM 的模型——並提供 OpenAI 相容的 API 以便輕鬆整合。

How it works

該專案利用 MLX 框架並編譯成單一原生二進位檔。它採用了多種先進的優化技術來極大化 Apple Silicon 的效能:

  • TurboQuantization: 一種混合 KV cache 壓縮架構,透過非線性 Lloyd-Max codebooks 和融合 Metal shaders,將記憶體使用量減少約 3.5 倍。
  • SSD Expert Streaming: 針對 Mixture of Experts (MoE) 模型設計的專用管線,可將專家層直接從 NVMe SSD 串流至 GPU,讓 Qwen3.5-397B 等模型能在有限的 RAM 中執行。
  • Speculative Decoding: 使用小型草稿模型來預測 token,再由較大的主模型進行批量驗證,以提高吞吐量。
  • Native Multimodal Support: 包含用於視覺 (--vision) 和音訊 (--audio) 處理的專用標記,使用 Metal 和 AVFoundation。

Who it’s for

  • Apple Silicon 使用者,希望以最高效率在本地執行尖端開源權重模型。
  • 開發者,需要為其應用程式提供即插即用的 OpenAI 相容本地伺服器。
  • iOS 開發者,尋求實作裝置端 MLX 推理(透過內建的 SwiftBuddy 伴侶應用程式)。

Highlights

  • 100% Native: 不需要 Python;為 macOS 和 iOS 編譯成單一二進位檔。
  • OpenAI-Compatible: 支援 /v1/chat/completions 和串流。
  • Massive Model Support: 能夠透過 SSD 串流執行 100B+ 參數的 MoE 模型。
  • Broad Model Compatibility: 支援廣泛的模型系列,包括 Gemma 4, Qwen 3.5, Llama 3.3, DeepSeek V3, 和 Phi 4。
  • KV Cache Compression: 透過 TurboQuant 在長文本上下文中使用顯著的記憶體節省。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案