Falcon-H1:混合头语言模型的高效与性能

Hugging Face 与 TII UAE 发布了 Falcon-H1 系列,这是一套包含六个开源语言模型,参数规模从 0.5B 到 34B。通过在混合架构中将经典的基于 Transformer 的注意力与 Mamba-2 状态空间模型(SSM)相结合,Falcon-H1 实现了与更大规模 Transformer 模型相当的性能,同时显著提升了推理速度和内存效率,尤其在长上下文长度下表现突出。

混合架构:结合注意力与 SSM

Falcon-H1 使用并行的混合混合器块,将注意力头与 Mamba-2 头集成。该设计使得注意力头与 SSM 头的比例可以独立调节,从而实现仅需相对较少的注意力即可获得高性能的配置。

关键的架构优化包括:

  • SSM 参数: 基于 Mamba-2 架构,模型使用更大的记忆体规模来提升性能,几乎不增加效率成本。
  • 注意力参数: 模型采用标准的全注意力层,但在旋转位置嵌入(RoPE)中使用极大规模的参数以提升性能,因为 SSM 组件本身已经处理了一部分位置信息。
  • 深度 vs. 宽度: 增加模型深度被发现对性能影响最大。这促成了 Falcon-H1-1.5B-Deep 变体的诞生,该变体在参数量较小的情况下实现了最大性能。

模型规模与能力

Falcon-H1 提供六种规模,每种规模都有基础模型和指令微调变体,采用宽松的基于 Apache 2.0 的许可证发布:

  • 0.5B
  • 1.5B
  • 1.5B-Deep
  • 3B
  • 7B
  • 34B

性能基准

Falcon-H1 模型的设计目标是匹配或超越至少是其规模两倍的模型性能。具体而言,Falcon-H1-0.5B 的表现可与 2024 年常见的 7B 模型相媲美,而 Falcon-H1-1.5B-Deep 则可与领先的 7B–10B 模型相竞争。

多语言与 STEM 支持

  • 多语言能力: 模型原生支持 18 种语言(包括阿拉伯语、中文、英语、法语、德语、日语、韩语、俄语和西班牙语),并可通过多样化的多语言分词器扩展至超过 100 种语言。
  • STEM: 在训练过程中优先使用高质量的 STEM 数据,以确保在数学和科学方面具备强大的能力。
  • 上下文窗口: 该系列支持最长达 256K token 的上下文长度,便于处理长文档和多轮对话。

训练策略与动态

Falcon-H1 的开发在训练策略上突破了标准 Transformer 的惯例,以优化混合架构。

数据策略

与传统的课程学习相反,Falcon-H1 采用了一种策略,从训练伊始就引入复杂数据(如高级数学和长上下文样本),让模型有更多时间学习复杂任务所需的关键特征。此外,团队使用了“记忆窗口”估计,以更频繁地复用高质量样本,而不会损害模型的泛化能力。

定制化的最大更新参数化 (μP)

为了在六种模型规模之间实现高效的扩展,团队使用了 μP 超参数迁移。他们在经典 μP 的基础上进行改进,将模型参数划分为 35 个细粒度组,并在基础模型规模下联合优化各自的乘子,而不是假设乘子为 1 的平凡情况。

稳定性与噪声控制

为了解决 SSM 基础模型中常见的训练波动,团队在 SSM 块内实现了对 μP 乘子的阻尼。他们还将权重衰减整合到训练计划和 μP 乘子中,以更好地控制参数范数。

推理效率与吞吐量

随着上下文长度的增加,Falcon-H1 相较于纯 Transformer 模型展现出显著的可扩展性优势。与 Qwen2.5-32B 相比,Falcon-H1 在更长序列长度下可实现 输入吞吐量提升 4 倍(预填充)和 输出吞吐量提升 8 倍(生成)。

由于当前推理流水线中对注意力的优化更为成熟,纯 Transformer 在极短上下文长度下可能略快一些,但随着序列长度的增长,混合架构的效率优势将变得占主导地位。

Sources