Llama 4 Maverick 與 Scout 發布說明
Meta 宣佈發布 Llama 4 Maverick 與 Llama 4 Scout,這兩款基於混合專家(MoE)架構的原生多模態大型語言模型。這些模型在上下文窗口容量、多模態處理以及架構效率方面帶來顯著的進步,且兩者皆使用 17B 的活躍參數。
模型變體與規格
Llama 4 引入了兩種主要的模型變體,以因應不同的部署規模:
- Llama 4 Maverick:一款高容量模型,總參數約 400B,擁有 128 位專家,使用 17B 的活躍參數。
- Llama 4 Scout:一款高效模型,總參數約 109B,擁有 16 位專家,使用 17B 的活躍參數。
兩款模型皆在多達 40 兆個令牌、涵蓋 200 種語言的資料上進行訓練,並針對 12 種語言(包括阿拉伯語、西班牙語、德語與印地語)進行了專門的微調。它們利用早期融合的原生多模態能力,能同時處理文字與圖像輸入。
架構創新
Llama 4 採用了多項新穎的架構選擇,以支援極長的上下文長度並提升計算效率:
iRoPE 架構與 NoPE 層
為了處理長上下文,Llama 4 使用 iRoPE 架構,將傳統的 Rotary Positional Embeddings(RoPE)與 NoPE(無位置編碼) 層交錯。NoPE 層每四層出現一次,並在整個上下文上使用完整的因果遮罩,這對於在長序列中維持效能至關重要。
分塊注意力
在 RoPE 層(每四層中的三層)中,Llama 4 實作 分塊注意力。分塊注意力長度為 8,192,這些層僅在 8K 區塊內追蹤上下文,較標準注意力減少了記憶體與計算需求。
注意力溫度調整
為防止在極長序列中注意力機率分數因 softmax 函數而趨近於零的常見問題,Llama 4 在 NoPE 層中使用 溫度調整(縮放的 softmax),以提升在任意上下文長度上的泛化能力。
其他技術增強
- QK 正規化:Llama 4 Scout 在嵌入後的 RoPE 層中,對 Query 與 Key 狀態使用不含可學習參數的 RMS 正規化。
- MoE 交錯:Scout 為完整的 MoE,而 Maverick 則在 MoE 與密集層之間交錯,僅在一半的層中使用專家。
- 共同蒸餾:Maverick 透過動態損失函數,從更大的模型 Llama Behemoth 共同蒸餾而來,以加權學生與教師的 logits。
- MetaP:這些模型使用 MetaP,一種在訓練預算與模型規模間最佳化超參數調整的方法。
上下文窗口與效能
Llama 4 模型在預訓練時的上下文長度為 256K。經指令微調的變體大幅擴展了此容量:
| 模型 | 指令微調 | 上下文長度 |
|---|---|---|
| Scout (16E) | 是 | 10M |
| Maverick (128E) | 是 | 1M |
| Scout (16E) | 否 | 256K |
| Maverick (128E) | 否 | 256K |
評估與基準測試
經指令微調的 Llama 4 模型在推理、知識與多模態任務上優於前代模型,如 Llama 3.1 405B:
- 推理與知識:Maverick 在 MMLU Pro 上取得 80.5%,在 GPQA Diamond 上取得 69.8%。
- 程式碼:Maverick 在 LiveCodeBench(pass@1)上得分 43.4%。
- 多模態推理:Maverick 在 MMMU 上取得 73.4%,在 ChartQA 上取得 90.0%。
- 影像理解:Scout 在 DocVQA(預訓練)上取得 91.6%,在 DocVQA 測試集(指令微調)上取得 94.4%。
部署與整合
Llama 4 已透過 transformers v4.51.0、Text Generation Inference(TGI)以及 Xet 儲存後端整合至 Hugging Face 生態系統。
- 量化:Llama 4 Scout 支援即時 4 位元或 8 位元量化,以適配單一伺服器等級 GPU。Llama 4 Maverick 提供 BF16 與 FP8 格式。
- 儲存:使用 Xet 儲存可為基礎模型達到約 25% 的重複資料消除,衍生模型則可高達 40%,加速上傳與下載。
- 授權:模型以自訂的 Llama 4 社群授權協議發布。