ZAYA1-8B: 以760M有效參數達成DeepSeek-R1數學性能

大型語言模型(LLM)效率的追求長期以來一直是原始參數數量與實際性能之間的拔河。儘管產業趨向龐大模型,但高效率、小腳印模型的新興趨勢正在出現。ZAYA1-8B 在此方向上代表了一個重要里程碑,聲稱僅使用7.6億有效參數即可在數學任務上與 DeepSeek-R1 相匹配。

此模型表明,「越大越好」的格言正透過架構創新受到挑戰,特別是透過使用混合專家(MoE)和新穎的推理追蹤管理。

架構:MoE 與 Markovian RSA

其核心,ZAYA1-8B 是一個具有 8B 參數的混合專家模型。此處的關鍵區別在於 有效 參數的數量——即模型在單次前向傳遞中實際參與的子集。透過將有效參數保持在 760M,該模型達成了一種計算效率水平,使其能夠在商用硬體和本地環境中部署。

ZAYA1-8B 最引人注目的技術面之一是其對 Markovian RSA 的實現。此方法是兩種不同方法論的綜合:

  1. Reasoning-Step Analysis (RSA): 此方法會為給定的提示產生一系列推理追蹤,以映射出達到解決方案的邏輯路徑。
  2. The Markovian Thinker: 此機制管理這些推理追蹤的長度,以保持上下文窗口的可管理性。它通過從追蹤尾端修剪可調整的數量 ($\tau$) 的標記來實現。

在受監督微調(SFT)階段,模型會被訓練將最相關的資訊集中在追蹤的末端,以確保修剪過程不會捨棄關鍵的邏輯飛躍。然而,此架構選擇在觀察者間引發了技術討論,有人質疑僅從尾端切斷標記是否為保存洞見的最有效方式,或是寶貴的資訊可能會在追蹤較早的部分遺失。

真實世界表現與實用性

儘管基準顯示其在數學方面與 DeepSeek-R1 相當,但使用者體驗提供了對其在編碼和代理任務能力更細膩的觀點。

編碼能力

早期測試者報告該模型在編碼方面是「模糊具競爭力」的。在實際測試中——例如為瀏覽器控制台生成功能計時器的 JavaScript——該模型成功產生了可運作的代碼,儘管需要後續的修正提示才能達到預期結果。這表明,儘管該模型在其規模下具有高度能力,但它可能尚未成為像 Claude 或 GPT-4 這類前沿模型在複雜軟體工程任務中的「即插即用」替代品。

代理差距

模型的數學推理與其代理性能之間存在顯著差異。一些評論家認為,雖然數學和編碼能力令人印象深刻,但代理能力——具體而言,使用工具呼叫來收集上下文並執行解決方案的能力——發展得較為不足。如果該模型想成為專有編碼助理的可行替代品,這是一個關鍵的障礙需要克服。

對本地 LLMs 的更廣泛影響

ZAYA1-8B 的發布預示著一種更廣泛的趨勢,即 AI 的民主化。能夠在沒有網路連線的桌上型電腦上運行具有 760M 有效參數且能處理複雜數學與編碼任務的模型,對注重隱私的開發者和研究者而言是一個具有吸引力的前景。

正如社區所觀察到的,推動 10T 參數模型的擴展定律可能無法永續。焦點正在轉移到如何壓縮更多資訊,以及如何在較小的模型中有效地實現基於搜索的推理。像 Zyphra 這樣的實驗室的出現以及像 AMD 這樣的硬體供應商的參與,顯示出一個正在成長的生態系統,致力於在商用硬體上讓 SOTA(最先進)性能變得可及。

"我相信小型模型是 LLM 的未來……兩年內,我們可能會真的驚訝於在具有商用硬體的桌上型電腦、無網路連線以及少數能覆蓋任務子集的模型下可以達成什麼。"

透過優化總參數與有效參數之間的平衡,ZAYA1-8B 為一種未來鋪平了道路:在該未來中,高階推理能力不再被昂貴的 API 呼叫所限制,而是分佈在高效、優先本地的架構上。

Sources