IBM Granite 4.1 LLMs 发行说明 / 技术概览
IBM Granite 4.1 LLMs 发行说明 / 技术概览
IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的大型语言模型(LLMs),包含 3B、8B 和 30B 参数变体。这些模型在大约 15 万亿个标记上进行训练,并利用多阶段预训练和强化学习管道,在数学、编码和指令遵循方面实现高性能,其中 8B 模型显著地匹配或超越了更大的混合专家(MoE)架构。
模型架构
Granite 4.1 模型采用仅解码器的密集型 Transformer 架构。所有三种模型规模(3B、8B 和 30B)共享相同的训练管道和数据策略,仅在特定的架构维度上有所不同。
关键架构组件包括:
- 分组查询注意力(GQA)
- 旋转位置嵌入(RoPE)
- SwiGLU 激活函数
- RMSNorm
- 共享输入/输出嵌入
| 组件 | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| 嵌入大小 | 2560 | 4096 | 4096 |
| 层数 | 40 | 40 | 64 |
| 注意力头大小 | 64 | 128 | 128 |
| 注意力头数量 | 40 | 32 | 32 |
| KV头数量 | 8 | 8 | 8 |
| MLP 隐藏层大小 | 8192 | 12800 | 32768 |
| MLP 激活函数 | SwiGLU | SwiGLU | SwiGLU |
| 位置嵌入 | RoPE | RoPE | RoPE |
五阶段预训练策略
这些模型在大约 15 万亿个标记上从零开始训练,采用五阶段策略,逐步从广泛的网络规模数据转向高度策划的特定领域内容。
第一阶段:通用预训练
此阶段使用 10 万亿个标记建立基础语言理解。数据组成主要为 CommonCrawl(59%),其次为 Code(20%)、Technical(10.5%)、Math(7%)和 Multilingual(~2%)。
第二阶段:数学和代码重点
第二阶段通过增加数学和编程数据的比例来提升推理能力。混合数据包括 Math(35%)、Code(30%)、CommonCrawl-HQ(12%)、Technical(10%)、Synthetic(9%)和 Multilingual(3%)。
第三及第四阶段:高质量数据退火
这些中期训练阶段专注于高质量数据混合,并引入了链式思考和合成指令数据。
- 第三阶段(2T tokens): 混合 CommonCrawl-HQ、数学、代码、技术、合成、长链式思考以及语言/代码指令。
- 第四阶段(0.5T tokens): 通过侧重最高质量的数据进一步提炼模型,其中 CommonCrawl-HQ 占比 40%、代码 20%、数学 20%。
第五阶段:长上下文训练(LCE)
最终阶段通过分阶段扩展过程(32K、128K,最终 512K)将上下文窗口从 4K 扩展到 512K 标记。对于 8B 和 30B 模型的 512K 扩展,使用了 80% 书籍和 20% 代码仓库数据的混合。为了防止短上下文性能下降,在每个 LCE 阶段后会执行模型合并。
监督微调(SFT)和质量控制
Granite 4.1 模型使用大约 410 万个高质量样本进行 SFT。为确保数据完整性,IBM 采用 LLM-as-Judge 框架 alongside 基于规则的过滤。
LLM-as-Judge 框架
该框架在六个加权维度上评估助手响应:指令遵循、正确性、完整性、简洁性、自然性和校准。裁判会忽略系统提示、用户输入和检索到的文档,以严格关注模型的响应。对于幻觉、错误前提或错误计算等关键缺陷,会应用硬拒绝规则。
SFT 训练配置
- 计算: 16 个节点,每节点 4x GB200
- 轮数: 3
- 序列长度: 16,384 标记
- 有效批次大小: 256 样本/迭代
多阶段强化学习(RL)
在 SFT 之后,模型会经历一个多阶段的 RL 管道,以优化特定能力同时最小化灾难性遗忘。
训练方法论
模型使用 On-policy GRPO(组相对策略优化) 以及 DAPO(解耦裁剪和动态采样策略优化)损失。管道由四个顺序阶段组成:
- 多领域 RL: 在数学、科学、逻辑、指令遵循、结构化输出、Text2SQL、时间推理和一般聊天方面进行联合训练。
- RLHF(来自人类反馈的强化学习): 使用多语言标量奖励模型来提升有用性和对话质量。
- 身份与知识校准 RL: 一个短阶段(~40 步)以提升自我识别能力。
- 数学 RL: 一个有针对性的阶段,以恢复和提升在 RLHF 阶段中丢失的数学推理能力。
性能和基准测试
Granite 4.1 模型在通用、数学、代码和多语言任务上表现出强劲的性能。一个显著的发现是,Granite 4.1-8B 密集模型 在几个关键基准测试中匹配或超越了前一代 Granite 4.0-H-Small (32B-A9B MoE),包括 IFEval、AlpacaEval、MMLU-Pro 和 GSM8K。
关键指令模型基准测试
| 基准测试 | 3B | 8B | 30B |
|---|---|---|---|
| MMLU (5 次) | 67.02 | 73.84 | 80.16 |
| GSM8K (8 次) | 86.88 | 92.49 | 94.16 |
| HumanEval (pass@1) | 79.27 | 87.20 | 89.63 |
| AlpacaEval 2.0 | 38.57 | 50.08 | 56.16 |
| BFCL v3 | — | 68.27 | 73.68 |
部署和基础设施
Granite 4.1 模型在 Apache 2.0 许可证 下发布。为了高效推理,提供 FP8 量化变体,相比 16 位精度,可将磁盘占用和 GPU 内存使用降低约 50%。
训练在 CoreWeave 托管的 NVIDIA GB200 NVL72 集群 上进行,利用 72-GPU NVLink 域进行机架内通信,以及使用无阻塞 Fat-Tree NDR 400 Gb/s InfiniBand 网络进行机架间通信。
摘要: IBM 发布了 Granite 4.1,这是一系列密集型、仅解码器的 LLMs(3B、8B、30B),通过严格的数据策划和多阶段强化学习管道实现高性能。