Helldez/BigMoeOnEdge

Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp

解决的问题

BigMoeOnEdge 允许用户在 RAM 有限的设备(如智能手机或仅使用 CPU 的 PC)上运行大型混合专家(MoE)模型。它解决了模型大于可用系统内存时通常无法加载或导致操作系统因过度交换(mmap 故障风暴)而崩溃/变慢的问题。

工作原理

该引擎不将整个模型加载到 RAM 中,而是将闪存存储视为内存层次结构的一部分。它仅将模型中始终必需的核心部分保留在内存中,并在需要时直接从闪存存储中流式传输每个生成令牌所需的特定“专家”。

它基于 llama.cpp 公开 API 构建,因此支持 llama.cpp 支持的所有量化格式和分词器。它原生支持多分片 GGUF 文件,无需合并步骤。

适用人群

希望在内存受限的消费级硬件(特别是 Android 手机或仅 CPU 的 PC)上运行超大规模 MoE 模型(例如 100B+ 参数)的开发者和 AI 爱好者。

主要亮点

  • 极致内存效率:可在仅 12 GB RAM 的手机上运行 DeepSeek V4 Flash(284B 参数,约 91 GB)等大型模型。
  • 无损流式传输:默认情况下,输出与将模型完全驻留在 RAM 中运行时完全相同(字节级一致)。
  • 性能调优:提供多种“旋钮”以平衡速度与质量,例如专家缓存、并行 I/O 通道,以及丢弃“冷”专家或减少活跃专家数量等有损优化。
  • Android 应用:提供可立即使用的聊天应用,包含模型下载器和实时遥测功能,可监控每秒生成的令牌数和缓存命中率。
  • 广泛架构支持:支持多种 MoE 架构,包括 Qwen、Gemma、DeepSeek 和 Liquid AI LFM2。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目