ZAYA1‑8B:以 760M 活跃参数实现 DeepSeek‑R1 的数学性能

对大语言模型(LLM)效率的追求长期以来一直是参数规模与实际性能之间的拉锯战。虽然业界一直倾向于构建巨型模型,但一种朝向高效、占用空间小的模型的新趋势正在出现。ZAYA1-8B 在此方向上标志着重要里程碑,声称在数学任务上能够匹配 DeepSeek‑R1,同时仅使用 760 百万活跃参数。

该模型展示了“更大更好”的口号正被架构创新所挑战,尤其是通过使用混合专家(Mixture‑of‑Experts,MoE)和新颖的推理轨迹管理实现的。

架构:MoE 与马尔可夫 RSA

从本质上讲,ZAYA1-8B 是一个 8 B 参数的混合专家模型。关键区别在于 活跃 参数的数量——即在单次前向传播中实际被调用的模型子集。通过将活跃参数保持在 760 M,模型实现了计算效率,使其能够在普通硬件和本地环境中部署。

ZAYA1-8B 最引人注目的技术点之一是其实现的 马尔可夫 RSA。该方法融合了两种不同的技术路线:

  1. 推理步骤分析(Reasoning‑Step Analysis,RSA): 为给定提示生成一系列推理轨迹,以绘制通向解答的逻辑路径。
  2. 马尔可夫思考者(Markovian Thinker): 该机制管理这些推理轨迹的长度,使上下文窗口保持可控。它通过从轨迹尾部裁剪可调数量($\tau$)的 token 来实现。

在监督微调(SFT)阶段,模型被训练将最相关的信息集中在轨迹的末端,确保裁剪过程不会丢失关键的逻辑跳跃。然而,这一架构选择在观察者中引发了技术争论,有人质疑仅从尾部裁剪 token 是否是保留洞见的最有效方式,或者是否会导致更早的有价值信息被遗漏。

实际性能与实用性

虽然基准测试显示在数学方面与 DeepSeek‑R1 持平,但用户体验对其在编码和代理任务上的能力提供了更细致的视角。

编码能力

早期测试者报告称模型在编码方面“略有竞争力”。在实际测试中——例如为浏览器控制台生成一个功能性计时器的 JavaScript——模型成功生成了可运行的代码,但需要后续的纠错提示才能达到预期结果。这表明,尽管模型在其规模下表现出色,但在复杂软件工程任务上仍未能成为 Claude 或 GPT‑4 等前沿模型的“即插即用”替代品。

代理能力差距

模型的数学推理与其代理性能之间存在明显差异。一些批评者认为,虽然数学和编码表现令人印象深刻,但代理能力——尤其是使用工具调用获取上下文并执行解决方案的能力——仍显不足。若要成为专有编码助手的可行替代品,这将是模型必须跨越的关键障碍。

对本地 LLM 的更广泛意义

ZAYA1-8B 的发布标志着 AI 民主化的更大趋势。能够在桌面上运行拥有 760 M 活跃参数、能够处理复杂数学和编码任务的模型,而无需互联网连接,对注重隐私的开发者和研究者具有强大吸引力。

正如社区所观察到的,推动 10 T 参数模型的规模律可能不可持续。焦点正转向信息压缩的极限以及在小模型中实现基于搜索的推理的有效性。Zyphra 等实验室的崛起以及 AMD 等硬件供应商的参与,表明一个致力于在普通硬件上实现 SOTA(State‑of‑the‑Art)性能的生态系统正在形成。

"我认为小模型是 LLM 的未来……两年后,我们可能会对在普通硬件的桌面上、无需互联网连接、只运行少数覆盖部分任务的模型能做到的事情感到惊讶。"

通过优化总参数与活跃参数之间的平衡,ZAYA1-8B 为一个高推理能力不再被昂贵 API 调用所垄断、而是分布在高效、本地优先架构中的未来铺平了道路。

Sources