Llama 4 Maverick 与 Scout 发布说明

Meta 宣布发布 Llama 4 Maverick 和 Llama 4 Scout,这些基于 Mixture-of-Experts(MoE)架构的原生多模态大语言模型。它们在上下文窗口容量、多模态处理以及架构效率方面实现了显著进步,两款模型均使用 17B 的活跃参数。

模型变体与规格

Llama 4 引入了两种主要模型变体,以适应不同的部署规模:

  • Llama 4 Maverick:一种高容量模型,约 400B 总参数和 128 位专家,使用 17B 活跃参数。
  • Llama 4 Scout:一种高效模型,约 109B 总参数和 16 位专家,使用 17B 活跃参数。

两款模型在 200 种语言上使用多达 40 万亿 token 进行训练,并针对包括阿拉伯语、西班牙语、德语和印地语在内的 12 种语言进行专门微调。它们采用早期融合实现原生多模态,能够同时处理文本和图像输入。

架构创新

Llama 4 采用了多项新颖的架构设计,以支持极长的上下文长度并提升计算效率:

iRoPE 架构与 NoPE 层

为管理长上下文,Llama 4 使用 iRoPE 架构,将传统的 Rotary Positional Embeddings(RoPE)与 NoPE(无位置编码) 层交错。NoPE 层每四层出现一次,并在整个上下文上使用完整的因果掩码,这对于在长序列中保持性能至关重要。

分块注意力

在 RoPE 层(每四层中的三层)中,Llama 4 实现了 分块注意力。分块注意力长度为 8,192,这些层仅在 8K 块中跟踪上下文,相比标准注意力可降低内存和计算需求。

注意力温度调节

为防止在极长序列中注意力概率分数趋于零(softmax 常见问题),Llama 4 在 NoPE 层中使用 温度调节(缩放 softmax),以提升在任意上下文长度上的泛化能力。

其他技术增强

  • QK 归一化:Llama 4 Scout 在 RoPE 层的查询(Query)和键(Key)状态上使用无可学习参数的 RMS 归一化,嵌入后应用。
  • MoE 交错:Scout 为完整的 MoE,而 Maverick 在 MoE 与密集层之间交错,仅在一半层中使用专家。
  • 协同蒸馏:Maverick 通过协同蒸馏自更大的模型 Llama Behemoth,使用动态损失函数对学生和教师的 logits 加权。
  • MetaP:这些模型使用 MetaP 方法,在不同的训练预算和模型规模下对超参数进行最优调优。

上下文窗口与性能

Llama 4 模型在预训练阶段使用 256K 的上下文长度。指令微调的变体显著扩展了该容量:

模型 指令微调 上下文长度
Scout (16E) 10M
Maverick (128E) 1M
Scout (16E) 256K
Maverick (128E) 256K

评估与基准

指令微调的 Llama 4 模型在推理、知识和多模态任务上优于前代模型,如 Llama 3.1 405B:

  • 推理与知识:Maverick 在 MMLU Pro 上达到 80.5%,在 GPQA Diamond 上达到 69.8%。
  • 编码:Maverick 在 LiveCodeBench(pass@1)上得分 43.4%。
  • 多模态推理:Maverick 在 MMMU 上取得 73.4%,在 ChartQA 上取得 90.0%。
  • 图像理解:Scout 在 DocVQA(预训练)上得分 91.6%,在 DocVQA 测试集(指令微调)上得分 94.4%。

部署与集成

Llama 4 通过 transformers v4.51.0、文本生成推理(TGI)以及 Xet 存储后端集成到 Hugging Face 生态系统中。

  • 量化:Llama 4 Scout 支持即时 4 位或 8 位量化,以适配单个服务器级 GPU。Llama 4 Maverick 提供 BF16 和 FP8 格式。
  • 存储:使用 Xet 存储对基础模型实现约 25% 的去重,对衍生模型可达 40%,加速上传和下载。
  • 许可:模型在自定义的 Llama 4 社区许可协议下发布。

Sources