Helldez/BigMoeOnEdge
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
解決的問題
BigMoeOnEdge 允許使用者在 RAM 有限的裝置(例如智慧型手機或僅使用 CPU 的 PC)上執行大型混合專家(MoE)模型。它解決了模型大於可用系統記憶體時,通常會拒絕載入或因過度交換(mmap 故障風暴)導致作業系統當機/變慢的問題。
工作原理
該引擎不將整個模型載入 RAM 中,而是將快閃記憶體視為記憶體階層的一部分。它僅將模型中始終需要的核心部分保留在記憶體中,並在需要時直接從快閃記憶體中流式傳輸每個產生的權杖所需的特定「專家」。
它基於 llama.cpp 公開 API 建構,因此支援 llama.cpp 支援的所有量化格式和分詞器。它原生支援多分割 GGUF 檔案,無需合併步驟。
適用對象
希望在記憶體受限的消費級硬體(特別是 Android 手機或僅 CPU 的 PC)上執行超大型 MoE 模型(例如 100B+ 參數)的開發者與 AI 愛好者。
主要亮點
- 極致記憶體效率:可在僅 12 GB RAM 的手機上執行 DeepSeek V4 Flash(284B 參數,約 91 GB)等大型模型。
- 無損串流:預設情況下,輸出與將模型完全駐留在 RAM 中執行時完全相同(位元級一致)。
- 效能調校:提供多種「旋鈕」以平衡速度與品質,例如專家快取、平行 I/O 通道,以及捨棄「冷」專家或減少活躍專家數量等損失式最佳化。
- Android 應用:提供可立即使用的聊天應用,包含模型下載器與即時遙測功能,可監控每秒產生的權杖數與快取命中率。
- 廣泛架構支援:支援多種 MoE 架構,包括 Qwen、Gemma、DeepSeek 與 Liquid AI LFM2。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案