Maple-Preview: 用于高速端侧推理的原生三值权重 MoE
DeepGrove 推出了 Maple-Preview,这是一个开源的 20B-A1B 三值权重推理大语言模型 (LLM)。该模型专为高性能端侧推理而设计,在 iPhone 上实现了 127 tokens/s 的速度,在 Mac mini M4 上实现了 218 tokens/s 的速度,显著超过了 Gemma 4 和 Qwen3.5 等其他高效模型。
用于推理效率的原生三值权重
Maple-Preview 是以原生三值权重格式进行训练的,而不是从全精度模型转换而来的。DeepGrove 认为,将预训练模型转换为较低位宽会不必要地限制性能和效率。通过在训练期间将低精度视为一等公民,该模型可以利用超低位宽的数学优势。
在超低位宽下,矩阵乘法可以有效地被加法取代,从而降低了推理所需的总算术工作量。这种架构选择使 Maple-Preview 能够保持较小的内存占用(5.31 GB checkpoint),同时支持 131,072-token 的上下文窗口。
硬件感知架构
为了优化端侧速度,Maple 架构通过硬件感知设计循环进行开发,其配置直接在 Mac mini 硬件上进行了测试。最终架构包括:
- 层与专家配置: 采用 24 层、256 专家的配置,旨在平衡推理性能与推理效率。
- 注意力机制: 采用滑动窗口与全局注意力的混合机制,以限制 KV-cache 的增长。
- 模型规模: 总参数量为 20.2B,激活参数量为 1.49B。
推理性能与基准测试
Maple-Preview 被定位为一款专注于推理的模型,在数学和技术领域展现出强大的能力。它在 MacBook Pro (M5 Pro) 上以 281.5 tokens/s 的速度成功解决了 IMO 2024 Problem 1 (7/7)。
在基准测试评估中,Maple-Preview(平均分:78.7)及其 Flash 版本(平均分:77.7)能够与更大规模的模型进行有效竞争。例如,在包括 LCBv6、AIME 26、HMMT 26 和 GPQA-D 在的一系列测试中,它优于 GPT-OSS 20B(平均分:76.3)和 Qwen3 30B-A3B(平均分:76.6)。
通过 "Dreaming" 进行端侧适配
DeepGrove 正在尝试通过端侧权重适配来超越基于上下文的记忆。与其将用户偏好存储在文本文件或长上下文中,该模型可以调整其权重以保留细微且用户特定的细节。
在提供的一个演示中,模型识别出用户对纯素饮食的限制,并安排了一次 "dream" 会话——这是一个模型生成一小组数据并进行自我训练的过程。该过程耗时 10–20 分钟,峰值内存占用为 5.9 GB。在此适配之后,模型可以泛化该偏好(例如,建议使用合成皮革包而非真皮包),而据报道,开启了记忆功能的 Claude Sonnet 5 在这项任务中失败了。
社区见解与批评
虽然在速度方面的技术成就受到了广泛赞誉,但 Hacker News 上的社区成员就模型的可靠性提出了几点看法:
- 幻觉: 用户报告称,该模型 "hallucinates knowledge quite aggressively",特别是在科学或技术领域之外的利基领域。
- 知识缺口: 一位用户指出,当被问及特定词汇的词源时,模型表现得 "confidently very incorrect",这表明 20B 参数规模可能会限制其通用知识库。
- 工具集成: 一些开发者建议,鉴于其速度和有限的内部知识,该模型的主要价值在于高质量的工具路由或作为小型任务集的快速备份模型。
- 实现质疑: 一些用户对 "dreaming" 机制表示怀疑,质疑这种规模的模型是否能有效地进行自我改进,或者该过程是否仅限于更新特定事实。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch