SharpAI/SwiftLM

⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.

What it solves

SwiftLM は Apple Silicon 向けに設計された高性能推論サーバーです。Python ランタイムやグローバルインタプリタロック (GIL) のオーバーヘッドを排除し、macOS と iOS 上でベアメタル性能で大規模言語モデル (LLM)、ビジョン・ランゲージモデル (VLM)、オーディオ・ランゲージモデル (ALM) を実行できます。

How it works

Swift と Metal でネイティブに構築された SwiftLM は、OpenAI 互換 API を使用して MLX モデルを提供します。限られたハードウェア上で巨大モデルを扱うために、以下の高度な最適化技術を採用しています:

  • SSD Expert Streaming:Mixture of Experts (MoE) モデルに対し、エキスパートの重みを NVMe SSD から直接 GPU にストリーミングします。これにより、Qwen3.5-397B のようなモデルを 64GB の RAM しかないマシンでも動作させられます。
  • TurboQuantization:ハイブリッド KV キャッシュ圧縮アーキテクチャで、FP16 と比べて約 3.5 倍のメモリ使用量削減を実現し、精度損失は最小限です。非線形 Lloyd‑Max コードブックを使用し、統合された Metal シェーダで処理します。
  • Speculative Decoding:小さなドラフトモデルでトークンを予測し、より大きなメインモデルがバルクで検証することで、RAM 内推論を高速化します。
  • Native Multimodal Support:ビジョン (--vision) とオーディオ (--audio) 用のフラグを提供し、リアルタイム画像解析や AVFoundation を介した音声入力をサポートします。

Who it’s for

  • Apple Silicon ユーザー:Mac や iPhone/iPad で可能な限り高速なローカル LLM 推論を求める開発者・研究者。
  • メモリ制約のあるユーザー:消費者向け Apple ハードウェア上で 100B 以上のパラメータを持つ最先端 MoE モデルを実行したい方。
  • iOS 開発者:同梱の SwiftBuddy companion アプリを通じて、デバイス上の MLX 推論をモバイルアプリに統合したい方。

Highlights

  • OpenAI-Compatible:OpenAI SDK のドロップイン置換。
  • 100% Native:Python 不要、単一バイナリにコンパイル。
  • Massive MoE Support:SSD ストリーミングでオーバーサイズモデルの最大 10 倍高速化。
  • KV Cache Compression:TurboQuant により 24GB RAM のマシンで 100k コンテキストウィンドウを処理可能。
  • Multimodal:VLM(例:Qwen2-VL)と ALM(例:Gemma 4 Omni)をネイティブにサポート。