IBM Granite 4.1 LLMs 发行说明 / 技术概览

IBM Granite 4.1 LLMs 发行说明 / 技术概览

IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的大型语言模型(LLMs),包含 3B、8B 和 30B 参数变体。这些模型在大约 15 万亿个标记上进行训练,并利用多阶段预训练和强化学习管道,在数学、编码和指令遵循方面实现高性能,其中 8B 模型显著地匹配或超越了更大的混合专家(MoE)架构。

模型架构

Granite 4.1 模型采用仅解码器的密集型 Transformer 架构。所有三种模型规模(3B、8B 和 30B)共享相同的训练管道和数据策略,仅在特定的架构维度上有所不同。

关键架构组件包括:

  • 分组查询注意力(GQA)
  • 旋转位置嵌入(RoPE)
  • SwiGLU 激活函数
  • RMSNorm
  • 共享输入/输出嵌入
组件 3B Dense 8B Dense 30B Dense
嵌入大小 2560 4096 4096
层数 40 40 64
注意力头大小 64 128 128
注意力头数量 40 32 32
KV头数量 8 8 8
MLP 隐藏层大小 8192 12800 32768
MLP 激活函数 SwiGLU SwiGLU SwiGLU
位置嵌入 RoPE RoPE RoPE

五阶段预训练策略

这些模型在大约 15 万亿个标记上从零开始训练,采用五阶段策略,逐步从广泛的网络规模数据转向高度策划的特定领域内容。

第一阶段:通用预训练

此阶段使用 10 万亿个标记建立基础语言理解。数据组成主要为 CommonCrawl(59%),其次为 Code(20%)、Technical(10.5%)、Math(7%)和 Multilingual(~2%)。

第二阶段:数学和代码重点

第二阶段通过增加数学和编程数据的比例来提升推理能力。混合数据包括 Math(35%)、Code(30%)、CommonCrawl-HQ(12%)、Technical(10%)、Synthetic(9%)和 Multilingual(3%)。

第三及第四阶段:高质量数据退火

这些中期训练阶段专注于高质量数据混合,并引入了链式思考和合成指令数据。

  • 第三阶段(2T tokens): 混合 CommonCrawl-HQ、数学、代码、技术、合成、长链式思考以及语言/代码指令。
  • 第四阶段(0.5T tokens): 通过侧重最高质量的数据进一步提炼模型,其中 CommonCrawl-HQ 占比 40%、代码 20%、数学 20%。

第五阶段:长上下文训练(LCE)

最终阶段通过分阶段扩展过程(32K、128K,最终 512K)将上下文窗口从 4K 扩展到 512K 标记。对于 8B 和 30B 模型的 512K 扩展,使用了 80% 书籍和 20% 代码仓库数据的混合。为了防止短上下文性能下降,在每个 LCE 阶段后会执行模型合并。

监督微调(SFT)和质量控制

Granite 4.1 模型使用大约 410 万个高质量样本进行 SFT。为确保数据完整性,IBM 采用 LLM-as-Judge 框架 alongside 基于规则的过滤。

LLM-as-Judge 框架

该框架在六个加权维度上评估助手响应:指令遵循、正确性、完整性、简洁性、自然性和校准。裁判会忽略系统提示、用户输入和检索到的文档,以严格关注模型的响应。对于幻觉、错误前提或错误计算等关键缺陷,会应用硬拒绝规则。

SFT 训练配置

  • 计算: 16 个节点,每节点 4x GB200
  • 轮数: 3
  • 序列长度: 16,384 标记
  • 有效批次大小: 256 样本/迭代

多阶段强化学习(RL)

在 SFT 之后,模型会经历一个多阶段的 RL 管道,以优化特定能力同时最小化灾难性遗忘。

训练方法论

模型使用 On-policy GRPO(组相对策略优化) 以及 DAPO(解耦裁剪和动态采样策略优化)损失。管道由四个顺序阶段组成:

  1. 多领域 RL: 在数学、科学、逻辑、指令遵循、结构化输出、Text2SQL、时间推理和一般聊天方面进行联合训练。
  2. RLHF(来自人类反馈的强化学习): 使用多语言标量奖励模型来提升有用性和对话质量。
  3. 身份与知识校准 RL: 一个短阶段(~40 步)以提升自我识别能力。
  4. 数学 RL: 一个有针对性的阶段,以恢复和提升在 RLHF 阶段中丢失的数学推理能力。

性能和基准测试

Granite 4.1 模型在通用、数学、代码和多语言任务上表现出强劲的性能。一个显著的发现是,Granite 4.1-8B 密集模型 在几个关键基准测试中匹配或超越了前一代 Granite 4.0-H-Small (32B-A9B MoE),包括 IFEval、AlpacaEval、MMLU-Pro 和 GSM8K。

关键指令模型基准测试

基准测试 3B 8B 30B
MMLU (5 次) 67.02 73.84 80.16
GSM8K (8 次) 86.88 92.49 94.16
HumanEval (pass@1) 79.27 87.20 89.63
AlpacaEval 2.0 38.57 50.08 56.16
BFCL v3 68.27 73.68

部署和基础设施

Granite 4.1 模型在 Apache 2.0 许可证 下发布。为了高效推理,提供 FP8 量化变体,相比 16 位精度,可将磁盘占用和 GPU 内存使用降低约 50%。

训练在 CoreWeave 托管的 NVIDIA GB200 NVL72 集群 上进行,利用 72-GPU NVLink 域进行机架内通信,以及使用无阻塞 Fat-Tree NDR 400 Gb/s InfiniBand 网络进行机架间通信。

摘要: IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的 LLMs(3B、8B、30B),通过严格的数据策划和多阶段强化学习管道实现高性能。

Sources