SharpAI/SwiftLM
⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.
何を解決するか
SwiftLMは、PythonランタイムやGlobal Interpreter Lock (GIL) のオーバーヘッドなしに、Apple Silicon上で大規模言語モデル (LLM) を実行するために設計された高性能推論サーバーです。ネイティブのSwiftとMetalを活用することで、物理RAMを超えるような巨大なモデルの実行を可能にし、容易な統合のためのOpenAI互換APIを提供します。
仕組み
このプロジェクトはMLXフレームワークを活用し、単一のネイティブバイナリにコンパイルされます。Apple Siliconのパフォーマンスを最大限に引き出すために、いくつかの高度な最適化技術を採用しています:
- TurboQuantization: 非線形Lloyd-Maxコードブックと融合されたMetalシェーダーを使用することで、メモリ使用量を約3.5倍削減するハイブリッドKVキャッシュ圧縮アーキテクチャ。
- SSD Expert Streaming: Mixture of Experts (MoE) モデル向けの特化型パイプラインで、エキスパートレイヤーをNVMe SSDからGPUへ直接ストリーミングすることで、Qwen3.5-397Bのようなモデルを限られたRAMで実行することを可能にします。
- Speculative Decoding: 小さなドラフトモデルを使用してトークンを予測し、より大きなメインモデルによって一括検証することでスループットを向上させます。
- Native Multimodal Support: MetalとAVFoundationを使用した、ビジョン (
--vision) およびオーディオ (--audio) 処理用の専用フラグを含みます。
対象ユーザー
- Apple Siliconユーザー:最先端のオープンウェイトモデルを最大限の効率でローカル実行したい方。
- 開発者:アプリケーションにそのまま導入できるOpenAI互換のローカルサーバーを必要としている方。
- iOS開発者:デバイス上でのMLX推論を実装したい方(同梱のSwiftBuddyコンパニオンアプリ経由)。
ハイライト
- 100% Native: Pythonは不要です。macOSおよびiOS用に単一のバイナリにコンパイルされます。
- OpenAI-Compatible:
/v1/chat/completionsとストリーミングをサポートします。 - Massive Model Support: SSDストリーミングを介して、100B+パラメータのMoEモデルを実行可能です。
- Broad Model Compatibility: Gemma 4, Qwen 3.5, Llama 3.3, DeepSeek V3, Phi 4 を含む幅広いモデルファミリーをサポートします。
- KV Cache Compression: TurboQuantにより、長いコンテキストにおいて大幅なメモリ節約を実現します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト