IBM Granite 4.2 发布说明

IBM 发布了 Granite 4.2,这是一个包含 3B、8B 和 30B 参数规模的稠密、仅解码器(decoder-only)推理 LLM 系列。这些模型专为显式推理而设计,支持可在思考(thinking)、非思考(non-thinking)和低努力(low-effort)模式之间切换的思维链过程,并根据 Apache 2.0 许可证发布。

Model Architecture and Pre-training

Granite 4.2 模型采用仅解码器稠密 Transformer 架构。关键技术规格包括具有 40 个注意力头和 8 个 KV 头部的 Grouped Query Attention (GQA),θ = 10,000,000 的 Rotary Position Embedding (RoPE),以及 MLP 中的 SwiGLU 激活函数。模型采用 bfloat16 精度进行训练。

Component 3B Dense 8B Dense 30B Dense
Embedding size 2560 4096 4096
Number of layers 40 40 64
Attention head size 64 128 128
Number of attention heads 40 32 32
Number of KV heads 8 8 8
MLP hidden size 8192 12800 32768
Sequence length 131,072 131,072 131,072

预训练是使用五阶段策略在约 15 万亿 tokens 上从头开始进行的。这一过程包括基础预训练、带有数据退火(data annealing)的中期训练,以及将上下文窗口扩展到 512K tokens 的最终阶段。

Supervised Fine-Tuning (SFT)

SFT 通过使用约 720 万个样本(约 100B tokens)的混合数据集将基础模型转换为指令遵循和推理助手。数据被分为:

  • Agentic Corpus (31.6%): 专注于软件工程 (69%)、工具调用 (12.1%)、终端使用 (8.0%)、数学 (3.5%)、搜索 (0.8%) 和动作 (0.2%)。
  • Non-Agentic Corpus (68.4%): 包括指令遵循 (18.8%)、代码 (18.8%)、数学 (14.6%)、多语言 (7.0%)、科学 (5.4%)、推理 (3.0%) 和安全性 (0.8%)。

质量控制涉及将数据规范化为 OpenAI Chat 格式,通过 GPT-OSS-120B 和 Gemma 4 进行基于 LLM 的评判,以及基于 SHA-256 的去重。 30B 模型还进行了专门针对 agentic coding 的第二阶段 SFT,通过对 SWE 和 coding 数据进行一次额外的 epoch 进行上采样。

Multi-Stage Reinforcement Learning Pipeline

Granite 4.2 采用使用 asynchronous Group Relative Policy Optimization (GRPO) 的多阶段 RL 流水线。该方法使用 leave-one-out 基准来消除对单独的价值网络(value network)的需求。该流水线是一系列热启动(warm-starts),其中每一阶段的策略都成为下一阶段的基础。

Foundational RL

所有模型规模都经过了基础 RL,其中包括:

  • RLVR (Verifiable-Reward RL): 最广泛的阶段,涵盖数学(包括 Lean formal proving)、竞争性编程、STEM MCQA、指令遵循和推理谜题。RLVR 在 3B/8B 上运行两轮,在 30B 上运行三轮。
  • Skill Boosters: 针对性运行以强化指令遵循(多轮对话、结构化输出)和竞争性编程。

Agentic RL (8B and 30B only)

8B 和 30B 模型还经过了一个额外的 agentic 模块,以学习在真实环境中进行工具交互:

  • SWE Agent: 使用 OpenHands harness 来编辑代码并在沙盒化 repositories 中运行测试,通过是否通过隐藏测试来获得奖励。

  • Terminal Agent: 通过 Terminus-2 harness 在实时 shell 中操作,rollout 运行次数可达 64 个环境轮次。

  • Search Agent: 使用实时 web-search 工具进行多跳研究,由 LLM 评判员进行奖励。

Alignment (RLHF)

每个模型最后都通过 RLHF 进行人类偏好对齐齐和安全性对齐,利用生成式奖励模型 (GenRM) 和安全性奖励。此阶段还应用了推理长度惩罚以减少冗余。

Infrastructure and Deployment

训练是在 NVIDIA GB200 NVL72 集群上完成的。软件栈利用 NeMo-RL 进行 GRPO 循环,并使用 NeMo-Gym 来编排 rollouts 并托管沙盒化资源。

Quantization and Serving

Four 种量化变体可用于 vLLM 推理:

  • FP8: 动态 per-channel 权重和 per-token 激活值。
  • FP4: 通过 GPTQ 量化的 NVFP4 和 MXFP4 版本。
  • GGUF: 通过 llama.cpp 提供的各种格式 (Q8_0 到 Q2_K)。

Performance Results

评估结果显示,推理能力随模型规模而扩展。30B 模型在 agentic coding 方面领先,在 SWE Bench Verified 上达到 { "tokens": "57.00" },在 Terminal-Bench 2.1 上达到 29.24。推理基准测试如 AIME25 显示出从 78.33 (3B) 到 89.17 (30B) 的递进。所有模型支持 12 种语言,包括 English, German, Spanish, French, Japanese, Portuguese, Arabic, Czech, Italian, Korean, Dutch, and Chinese。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目