TurboFieldfare: MシリーズMacでGemma 4 26Bを2GB RAMで実行する

TurboFieldfareは、Gemma 4 26B-A4Bモデルを、たとえ8 GBのRAMしか搭載していないベースモデルでも、アクティブなメモリ使用量を約2 GBに削減することで、あらゆるApple Silicon Mac上で実行できるようにします。これは、共有コアとKVキャッシュだけをメモリに保持し、必要なMoE(Mixture of Experts)ウェイトをSSDからリアルタイムでストリーミングすることで実現します。

SSDベースのエキスパートストリーミングアーキテクチャ

TurboFieldfareは、ルーティングされたエキスパート用にカスタムストリーミング機構を実装することで、14.3 GBのモデル全体をRAMにロードする必要性を回避します。

メモリ管理とI/O

各トランスフォーマーレイヤーで、エンジンは常駐ウェイトを使用してアテンションとルーターを計算します。CPUはルーターの上位8つのエキスパートIDを使用して、16スロットのLFU(Least Frequently Used)キャッシュに対してプランを立てます。必要なエキスパートがキャッシュに存在しない場合、エンジンは制限された並列pread呼び出しを実行し、Metalが参照できるバッファにロードします。効率を最大化するため、MetalはSSDの読み取りが進行中の間に、常駐する共有エキスパートブランチを同時に計算します。

重みの量子化とレイアウト

メモリ使用量をさらに削減するため、エンジンは特定の量子化フォーマットを使用します:

  • Weights: 埋め込み、アテンション、共有エキスパート、ルーティングエキスパートに対するMLX affine 4ビット(グループ64)
  • Router: 8ビット量子化。
  • KV Cache: 25層に対してスライディングウィンドウ方式、5層のフルアテンション層に対して線形ストレージを使用したFP16保存。

パフォーマンスベンチマーク

スループットはハードウェア世代と利用可能なシステムRAMに大きく依存し、OSページキャッシュがエキスパートを常駐させる能力に影響します。

ハードウェア 測定デコード速度
M2 MacBook Air (8 GB RAM) 5.1–6.3 tok/s
M4 Mac mini (16 GB RAM) ≅5 tok/s
M5 Pro (24 GB RAM) 31–35 tok/s
M4 Max (64 GB RAM) ≅48 tok/s

RAMが多いユーザー(例:64 GB)は、OSページキャッシュが12 GBのpacked_experts全体をメモリに常駐させることができるため、SSDのレイテンシが実質的に排除され、速度が大幅に向上すると報告しています。

実装とツール

TurboFieldfareは、llama.cppやMLXのような汎用フレームワークのラッパーではなく、Swift 6.2とMetal 4で記述されたモデル固有のランタイムです。以下のように複数のインターフェースを提供します:

  • Native Mac App: モデルのインストールとチャット用のSwiftUI/AppKitアプリケーション。
  • CLI: 指示チャットと生の補完のためのコマンドラインインターフェース。
  • OpenAI-Compatible Server: Chat Completionsと関数ツールをサポートするループバックサーバー。
  • Streaming Installer: Hugging Faceのチェックポイントを範囲リクエストで直接.gturbo形式に再パックするツールで、ディスク上に完全なソースチェックポイントを保存する必要がありません。

技術要件

TurboFieldfareを実行するには、以下の環境が必要です:

  • Hardware: Apple Silicon Mac(arm64)。
  • OS: Metal 4搭載のmacOS 26。
  • Development Tools: Xcode 26 と Swift 6.2 以上。
  • Storage: モデルインストール用に約14.3 GBの空き容量が必要です。

コミュニティの洞察と分析

ユーザー間の技術的議論は、LLMに対するSSDストリーミングの実用性に関していくつかの重要な点を浮き彫りにしています:

  • Comparison to mmap: llama.cppmmapを用いて低RAMで大規模モデルを実行できるのに対し、TurboFieldfareはSSDの読み取りを推論活動と同期させ、レイテンシを最小化します。
  • SSD Wear: ユーザーは継続的な重み読み取りがSSDの寿命に与える影響について疑問を呈していますが、ソースには具体的な劣化データは提供されていません。
  • Hardware Evolution: M2からM5への性能向上は、メモリ帯域幅の増加と高速SSDの普及により、大規模モデルのローカル推論がますます実用的になっていることを示唆しています。

「2GBで26Bを動かすことは、アパート全体を収納ユニットに収め、なおかつ歩き回る余裕があるのと同じエンジニアリング的な例えです」

Sources