IBM Granite 4.2 发布说明
IBM 发布了 Granite 4.2,这是一个包含 3B、8B 和 30B 参数规模的稠密、仅解码器(decoder-only)推理 LLM 系列。这些模型专为显式推理而设计,支持可在思考(thinking)、非思考(non-thinking)和低努力(low-effort)模式之间切换的思维链过程,并根据 Apache 2.0 许可证发布。
Model Architecture and Pre-training
Granite 4.2 模型采用仅解码器稠密 Transformer 架构。关键技术规格包括具有 40 个注意力头和 8 个 KV 头部的 Grouped Query Attention (GQA),θ = 10,000,000 的 Rotary Position Embedding (RoPE),以及 MLP 中的 SwiGLU 激活函数。模型采用 bfloat16 精度进行训练。
| Component | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| Embedding size | 2560 | 4096 | 4096 |
| Number of layers | 40 | 40 | 64 |
| Attention head size | 64 | 128 | 128 |
| Number of attention heads | 40 | 32 | 32 |
| Number of KV heads | 8 | 8 | 8 |
| MLP hidden size | 8192 | 12800 | 32768 |
| Sequence length | 131,072 | 131,072 | 131,072 |
预训练是使用五阶段策略在约 15 万亿 tokens 上从头开始进行的。这一过程包括基础预训练、带有数据退火(data annealing)的中期训练,以及将上下文窗口扩展到 512K tokens 的最终阶段。
Supervised Fine-Tuning (SFT)
SFT 通过使用约 720 万个样本(约 100B tokens)的混合数据集将基础模型转换为指令遵循和推理助手。数据被分为:
- Agentic Corpus (31.6%): 专注于软件工程 (69%)、工具调用 (12.1%)、终端使用 (8.0%)、数学 (3.5%)、搜索 (0.8%) 和动作 (0.2%)。
- Non-Agentic Corpus (68.4%): 包括指令遵循 (18.8%)、代码 (18.8%)、数学 (14.6%)、多语言 (7.0%)、科学 (5.4%)、推理 (3.0%) 和安全性 (0.8%)。
质量控制涉及将数据规范化为 OpenAI Chat 格式,通过 GPT-OSS-120B 和 Gemma 4 进行基于 LLM 的评判,以及基于 SHA-256 的去重。 30B 模型还进行了专门针对 agentic coding 的第二阶段 SFT,通过对 SWE 和 coding 数据进行一次额外的 epoch 进行上采样。
Multi-Stage Reinforcement Learning Pipeline
Granite 4.2 采用使用 asynchronous Group Relative Policy Optimization (GRPO) 的多阶段 RL 流水线。该方法使用 leave-one-out 基准来消除对单独的价值网络(value network)的需求。该流水线是一系列热启动(warm-starts),其中每一阶段的策略都成为下一阶段的基础。
Foundational RL
所有模型规模都经过了基础 RL,其中包括:
- RLVR (Verifiable-Reward RL): 最广泛的阶段,涵盖数学(包括 Lean formal proving)、竞争性编程、STEM MCQA、指令遵循和推理谜题。RLVR 在 3B/8B 上运行两轮,在 30B 上运行三轮。
- Skill Boosters: 针对性运行以强化指令遵循(多轮对话、结构化输出)和竞争性编程。
Agentic RL (8B and 30B only)
8B 和 30B 模型还经过了一个额外的 agentic 模块,以学习在真实环境中进行工具交互:
SWE Agent: 使用 OpenHands harness 来编辑代码并在沙盒化 repositories 中运行测试,通过是否通过隐藏测试来获得奖励。
Terminal Agent: 通过 Terminus-2 harness 在实时 shell 中操作,rollout 运行次数可达 64 个环境轮次。
Search Agent: 使用实时 web-search 工具进行多跳研究,由 LLM 评判员进行奖励。
Alignment (RLHF)
每个模型最后都通过 RLHF 进行人类偏好对齐齐和安全性对齐,利用生成式奖励模型 (GenRM) 和安全性奖励。此阶段还应用了推理长度惩罚以减少冗余。
Infrastructure and Deployment
训练是在 NVIDIA GB200 NVL72 集群上完成的。软件栈利用 NeMo-RL 进行 GRPO 循环,并使用 NeMo-Gym 来编排 rollouts 并托管沙盒化资源。
Quantization and Serving
Four 种量化变体可用于 vLLM 推理:
- FP8: 动态 per-channel 权重和 per-token 激活值。
- FP4: 通过 GPTQ 量化的 NVFP4 和 MXFP4 版本。
- GGUF: 通过 llama.cpp 提供的各种格式 (Q8_0 到 Q2_K)。
Performance Results
评估结果显示,推理能力随模型规模而扩展。30B 模型在 agentic coding 方面领先,在 SWE Bench Verified 上达到 { "tokens": "57.00" },在 Terminal-Bench 2.1 上达到 29.24。推理基准测试如 AIME25 显示出从 78.33 (3B) 到 89.17 (30B) 的递进。所有模型支持 12 种语言,包括 English, German, Spanish, French, Japanese, Portuguese, Arabic, Czech, Italian, Korean, Dutch, and Chinese。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 项目