SharpAI/SwiftLM

⚡ Native MLX Swift LLM inference server for Apple Silicon. OpenAI-compatible API, SSD streaming for 100B+ MoE models, TurboQuant KV cache compression, MACOS + iOS iPhone app.

何を解決するか

SwiftLMは、PythonランタイムやGlobal Interpreter Lock (GIL) のオーバーヘッドなしに、Apple Silicon上で大規模言語モデル (LLM) を実行するために設計された高性能推論サーバーです。ネイティブのSwiftとMetalを活用することで、物理RAMを超えるような巨大なモデルの実行を可能にし、容易な統合のためのOpenAI互換APIを提供します。

仕組み

このプロジェクトはMLXフレームワークを活用し、単一のネイティブバイナリにコンパイルされます。Apple Siliconのパフォーマンスを最大限に引き出すために、いくつかの高度な最適化技術を採用しています:

  • TurboQuantization: 非線形Lloyd-Maxコードブックと融合されたMetalシェーダーを使用することで、メモリ使用量を約3.5倍削減するハイブリッドKVキャッシュ圧縮アーキテクチャ。
  • SSD Expert Streaming: Mixture of Experts (MoE) モデル向けの特化型パイプラインで、エキスパートレイヤーをNVMe SSDからGPUへ直接ストリーミングすることで、Qwen3.5-397Bのようなモデルを限られたRAMで実行することを可能にします。
  • Speculative Decoding: 小さなドラフトモデルを使用してトークンを予測し、より大きなメインモデルによって一括検証することでスループットを向上させます。
  • Native Multimodal Support: MetalとAVFoundationを使用した、ビジョン (--vision) およびオーディオ (--audio) 処理用の専用フラグを含みます。

対象ユーザー

  • Apple Siliconユーザー:最先端のオープンウェイトモデルを最大限の効率でローカル実行したい方。
  • 開発者:アプリケーションにそのまま導入できるOpenAI互換のローカルサーバーを必要としている方。
  • iOS開発者:デバイス上でのMLX推論を実装したい方(同梱のSwiftBuddyコンパニオンアプリ経由)。

ハイライト

  • 100% Native: Pythonは不要です。macOSおよびiOS用に単一のバイナリにコンパイルされます。
  • OpenAI-Compatible: /v1/chat/completions とストリーミングをサポートします。
  • Massive Model Support: SSDストリーミングを介して、100B+パラメータのMoEモデルを実行可能です。
  • Broad Model Compatibility: Gemma 4, Qwen 3.5, Llama 3.3, DeepSeek V3, Phi 4 を含む幅広いモデルファミリーをサポートします。
  • KV Cache Compression: TurboQuantにより、長いコンテキストにおいて大幅なメモリ節約を実現します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト