Helldez/BigMoeOnEdge

Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

何を解決するか

BigMoeOnEdge は、スマートフォンや CPU 動作のみの PC など、メモリ制限のあるデバイス上で大規模な Mixture-of-Experts (MoE) モデルを実行できるようにします。システムメモリを超えるモデルは通常、ロードを拒否したり、過剰なスワッピング(mmap エラーの嵐)により OS がクラッシュまたは遅延する問題を解決します。

動作方法

モデル全体を RAM にロードするのではなく、エンジンはフラッシュストレージをメモリ階層の一部として扱います。常に必要となる基本的なモデル部分のみをメモリに保持し、各トークン生成時に必要な特定の「エキスパート」を、必要となる瞬間に直接フラッシュストレージからストリーミングします。

これは、llama.cpp のパブリック API の上に構築されており、llama.cpp がサポートするすべての量子化形式とトークナイザーをサポートしています。マージ手順を必要とせずに、マルチシャード GGUF ファイルをネイティブに処理できます。

対象ユーザー

メモリ制限が厳しいコンシューマーハードウェア(特に Android スマートフォンや CPU 動作のみの PC)で、巨大な MoE モデル(例:100B+ パラメータ)を実行したい開発者や AI アンチエスティスティックなユーザー。

特徴

  • 極めて高いメモリ効率:12 GB の RAM しかないスマートフォンで、DeepSeek V4 Flash(284B パラメータ、約 91 GB)のようなモデルを実行可能。
  • 損失なしストリーミング:デフォルトでは、RAM に完全にロードして実行した場合とバイト単位で同一の出力を得られます。
  • パフォーマンスチューニング:エキスパートキャッシュ、並列 I/O レーン、および「冷たい」エキスパートの削除やアクティブエキスパート数の削減といった損失あり最適化を含む、速度と品質のバランスを取るためのさまざまな「ノブ」を備えています。
  • Android アプリ:モデルダウンローダーとリアルタイムのテレメトリ(1秒あたりのトークン数、キャッシュヒット率)を備えた、すぐに使えるチャットアプリを提供。
  • 広範なアーキテクチャ対応:Qwen、Gemma、DeepSeek、Liquid AI LFM2 など、多数の MoE アーキテクチャをサポート。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト