SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
What it solves
SwiftLM は Apple Silicon 向けに設計された高性能推論サーバーです。Python ランタイムやグローバルインタプリタロック (GIL) のオーバーヘッドを排除し、macOS と iOS 上でベアメタル性能で大規模言語モデル (LLM)、ビジョン・ランゲージモデル (VLM)、オーディオ・ランゲージモデル (ALM) を実行できます。
How it works
Swift と Metal でネイティブに構築された SwiftLM は、OpenAI 互換 API を使用して MLX モデルを提供します。限られたハードウェア上で巨大モデルを扱うために、以下の高度な最適化技術を採用しています:
- SSD Expert Streaming:Mixture of Experts (MoE) モデルに対し、エキスパートの重みを NVMe SSD から直接 GPU にストリーミングします。これにより、Qwen3.5-397B のようなモデルを 64GB の RAM しかないマシンでも動作させられます。
- TurboQuantization:ハイブリッド KV キャッシュ圧縮アーキテクチャで、FP16 と比べて約 3.5 倍のメモリ使用量削減を実現し、精度損失は最小限です。非線形 Lloyd‑Max コードブックを使用し、統合された Metal シェーダで処理します。
- Speculative Decoding:小さなドラフトモデルでトークンを予測し、より大きなメインモデルがバルクで検証することで、RAM 内推論を高速化します。
- Native Multimodal Support:ビジョン (
--vision) とオーディオ (--audio) 用のフラグを提供し、リアルタイム画像解析や AVFoundation を介した音声入力をサポートします。
Who it’s for
- Apple Silicon ユーザー:Mac や iPhone/iPad で可能な限り高速なローカル LLM 推論を求める開発者・研究者。
- メモリ制約のあるユーザー:消費者向け Apple ハードウェア上で 100B 以上のパラメータを持つ最先端 MoE モデルを実行したい方。
- iOS 開発者:同梱の SwiftBuddy companion アプリを通じて、デバイス上の MLX 推論をモバイルアプリに統合したい方。
Highlights
- OpenAI-Compatible:OpenAI SDK のドロップイン置換。
- 100% Native:Python 不要、単一バイナリにコンパイル。
- Massive MoE Support:SSD ストリーミングでオーバーサイズモデルの最大 10 倍高速化。
- KV Cache Compression:TurboQuant により 24GB RAM のマシンで 100k コンテキストウィンドウを処理可能。
- Multimodal:VLM(例:Qwen2-VL)と ALM(例:Gemma 4 Omni)をネイティブにサポート。