Maple-Preview: 用於高速裝置端推理的原生三元權重 MoE

DeepGrove 推出了 Maple-Preview,這是一個開源的 20B-A1B 三元權重推理大型語言模型 (LLM)。該模型專為高效能裝置端推理而設計,在 iPhone 上達到每秒 127 個 token,在 Mac mini M4 上達到每秒 218 個 token,顯著超越了其他高效模型,如 Gemma 4 和 Qwen3.5。

用於推理效率的原生三元權重

Maple-Preview 是以原生三元權重格式進行訓練,而非從全精度模型轉換而來。DeepGrove 主張,將預訓練模型轉換為較低位元寬度會不必要地限制性能與效率。透過在訓練期間將低精度視為一等公民,模型可以利用超低位元寬度的數學優勢。

在超低位元寬度下,矩陣乘法可以有效地被加法取代,從而降低推理所需的總算術工作量。這種架構選擇讓 Maple-Preview 能在維持較小記憶體佔用(5.31 GB checkpoint)的同時,支援 131,072 個 token 的上下文窗口。

硬體感知架構

為了優化裝置端速度,Maple 架構是透過硬體感知設計迴圈開發的,其配置直接在 Mac mini 硬體上進行測試。最終架構包含:

  • 層與專家配置: 採用 24 層、256 個專家的配置,旨在平衡推理性能與推理效率。
  • 注意力機制: 結合滑動窗口與全域注意力機制,以限制 KV-cache 的增長。
  • 模型規模: 總參數為 20.2B,其中 1.49B 為啟動參數。

推理性能與基準測試

Maple-Preview 被定位為以推理為核心的模型,在數學與技術領域展現出強大的能力。它在 MacBook Pro (M5 Pro) 上成功解決了 IMO 2024 Problem 1 (7/7),速度為 281.5 tokens/s。

在基準測試評估中,Maple-Preview(平均分數:78.7)及其 Flash 版本(平均分數:77.7)能與較大的模型進行有效競爭。例如,在包括 LCBv6、AIME 26、HMMT 26 和 GPQA-D 的一系列測試中,它優於 GPT-OSS 20B(平均:76.3)和 Qwen3 30B-A3B(平均:76.6)。

透過「夢想」進行裝置端適應

DeepGrove 正在實驗裝置端權重適應,以超越基於上下文的記憶。與其將使用者偏好儲存在文字檔或長上下文之中,模型可以直接調整其權重以保留細微且針對使用者的特定細節。

在提供的演示中,模型識別出使用者的純素飲食限制,並安排了一個「夢想」階段——這是一個模型生成一組小型數據並進行自我訓練的過程。此過程耗時 10–20 分鐘,峰值記憶體利用率為 5.9 GB。在完成此適應後,模型可以泛化該偏好(例如,建議使用合成皮革包而非真皮包),而據報導,啟用了記憶功能的 Claude Sonnet 5 在這項任務中失敗了。

社群洞察與評論

雖然速度方面的技術成就廣受讚譽,但 Hacker News 上的社群成員對模型的可靠性提出了幾點看法:

  • 幻覺: 使用者回報模型「幻覺知識非常激進」,特別是在科學或技術領域之外的利基領域。
  • 知識缺口: 一位使用者指出,當被問及特定單字的詞源時,模型表現出「非常自信地給出錯誤答案」,這顯示 20B 參數規模可能會限制其通用知識庫。
  • 工具整合: 一些開發者建議,鑑於其速度與有限的內部知識,該模型的主要價值在於高品質的工具路由或作為小型任務集的快速備援模型。
  • 實作細節疑慮: 部分使用者對「夢想」機制表示懷疑,對模型是否能有效自我提升,或者該過程是否僅限於更新特定事實,提出了疑問。

Sources

相關