Helldez/BigMoeOnEdge
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
何を解決するか
BigMoeOnEdge は、スマートフォンや CPU 動作のみの PC など、メモリ制限のあるデバイス上で大規模な Mixture-of-Experts (MoE) モデルを実行できるようにします。システムメモリを超えるモデルは通常、ロードを拒否したり、過剰なスワッピング(mmap エラーの嵐)により OS がクラッシュまたは遅延する問題を解決します。
動作方法
モデル全体を RAM にロードするのではなく、エンジンはフラッシュストレージをメモリ階層の一部として扱います。常に必要となる基本的なモデル部分のみをメモリに保持し、各トークン生成時に必要な特定の「エキスパート」を、必要となる瞬間に直接フラッシュストレージからストリーミングします。
これは、llama.cpp のパブリック API の上に構築されており、llama.cpp がサポートするすべての量子化形式とトークナイザーをサポートしています。マージ手順を必要とせずに、マルチシャード GGUF ファイルをネイティブに処理できます。
対象ユーザー
メモリ制限が厳しいコンシューマーハードウェア(特に Android スマートフォンや CPU 動作のみの PC)で、巨大な MoE モデル(例:100B+ パラメータ)を実行したい開発者や AI アンチエスティスティックなユーザー。
特徴
- 極めて高いメモリ効率:12 GB の RAM しかないスマートフォンで、DeepSeek V4 Flash(284B パラメータ、約 91 GB)のようなモデルを実行可能。
- 損失なしストリーミング:デフォルトでは、RAM に完全にロードして実行した場合とバイト単位で同一の出力を得られます。
- パフォーマンスチューニング:エキスパートキャッシュ、並列 I/O レーン、および「冷たい」エキスパートの削除やアクティブエキスパート数の削減といった損失あり最適化を含む、速度と品質のバランスを取るためのさまざまな「ノブ」を備えています。
- Android アプリ:モデルダウンローダーとリアルタイムのテレメトリ(1秒あたりのトークン数、キャッシュヒット率)を備えた、すぐに使えるチャットアプリを提供。
- 広範なアーキテクチャ対応:Qwen、Gemma、DeepSeek、Liquid AI LFM2 など、多数の MoE アーキテクチャをサポート。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト