IBM Granite 4.2 Release Notes

IBM은 3B, 8B, 및 30B 파라미터 크기로 제공되는 밀집형(dense), decoder-only 추론 LLM 제품군인 Granite 4.2를 출시했습니다. 이 모델들은 명시적 추론을 위해 설계되었으며, thinking, non-thinking, 및 low-effort 모드 사이를 전환할 수 있는 chain-of-thought 프로세스를 지원하며, Apache 2.0 라이선스 하에 출시되었습니다.

Model Architecture and Pre-training

Granite 4.2 모델은 decoder-only 밀집형 transformer 아키텍처를 사용합니다. 주요 기술 사양에는 40개의 attention heads와 8개의 KV heads를 갖춘 Grouped Query Attention (GQA), θ = 10,000,000인 Rotary Position Embedding (RoPE), 그리고 MLP의 SwiGLU 활성화 함수가 포함됩니다. 모델은 bfloat16 정밀도로 학습되었습니다.

Component 3B Dense 8B Dense 30B Dense
Embedding size 2560 4096 4096
Number of layers 40 40 64
Attention head size 64 128 128
Number of attention heads 40 32 32
Number of KV heads 8 8 8
MLP hidden size 8192 12800 32768
Sequence length 131,072 131,072 131,072

사전 학습(Pre-training)은 5단계 전략을 사용하여 약 15 trillion tokens에 대해 처음부터 수행되었습니다. 이 프로세스는 기초 사전 학습, data annealing을 포함한 mid-training, 그리고 컨텍스트 윈도우를 512K tokens까지 확장하는 최종 단계로 구성됩니다.

Supervised Fine-Tuning (SFT)

SFT는 약 720만 개의 샘플(약 100B tokens)을 혼합하여 기본 모델을 지시사항 준수 및 추론 어시스턴트로 변환합니다. 데이터는 다음과 같이 나뉩니다:

  • Agentic Corpus (31.6%): 소프트웨어 엔지니어링(69%), tool calling(12.1%), terminal use(8.0%), math(3.5%), search(0.8%), 및 action(0.2%)에 집중합니다.
  • Non-Agentic Corpus (68.4%): 지시사항 준수(18.8%), coding(18.8%), math(14.6%), 다국어(7.0%), science(5.4%), reasoning(3.0%), 및 safety(0.8%)를 포함합니다.

품질 관리는 OpenAI Chat format으로의 정규화, GPT-OSS-120B 및 Gemma 4를 통한 LLM 기반 판정, 그리고 SHA-256 기반의 중복 제거를 포함했습니다. 30B 모델은 agentic coding을 위해 특별히 설계된 추가적인 두 번째 SFT 단계를 거쳤으며, SWE 및 coding 데이터의 upsampling을 위해 한 번의 추가 epoch를 수행했습니다.

Multi-Stage Reinforcement Learning Pipeline

Granite 4.2는 **asynchronous Group Relative Policy Optimization (GRPO)**를 사용하는 다단계 RL 파이프라인을 채택합니다. 이 방법은 별도의 value network가 필요 없는 leave-one-out baseline을 사용합니다. 파이프라인은 각 단계의 policy가 다음 단계의 base가 되는 warm-starts의 시퀀스입니다.

Foundational RL

모든 모델 크기는 다음과 같은 기초 RL을 거칩니다:

  • RLVR (Verifiable-Reward RL): 가장 광범위한 단계로, math(Lean formal proving 포함), competitive coding, STEM MCQA, 지시사항 준수, 및 reasoning puzzles를 다룹니다. RLVR은 3B/8B 모델에서 두 라운드, 30B 모델에서 세 라운드 진행됩니다.
  • Skill Boosters: 지시사항 준수(multi-turn chat, structured outputs) 및 competitive coding을 날카롭게 다듬는 타겟팅된 실행입니다.

Agentic RL (8B and 30B only)

8B 및 30B 모델은 실제 환경에서 tool interaction을 학습하기 위해 추가적인 agentic block을 거칩니다:

  • SWE Agent: OpenHands harness를 사용하여 sandboxed repositories에서 code를 편집하고 test를 실행하며, hidden tests가 통과하는지에 따라 보상을 받습니다.
  • Terminal Agent: Terminus-2 harness를 통해 live shell에서 작동하며, rollouts는 최대 64 environment turns에 이릅니다.
  • Search Agent: live web-search tools를 사용하여 multi-hop research를 수행하며, LLM judge에 의해 보상을 받습니다.

Alignment (RLHF)

모든 모델은 인간의 선호도와 안전성을 위해 generative reward model (GenRM) 및 safety reward를 활용한 RLHF로 마무리됩니다. 이 단계에서는 또한 장황함을 줄이기 위해 reasoning-length penalty를 reasoning-length penalty를 적용합니다. \n## Infrastructure and Deployment

학습은 NVIDIA GB200 NVL72 클러스터에서 수행되었습니다. 소프트웨어 스택은 GRPO 루프를 위한 NeMo-RL 및 rollouts를 조율하고 sandboxed resources를 호스트하는 NeMo-Gym을 사용합니다.

Quantization and Serving

vLLM 추론을 위한 네 가지 양자화된 변형이 제공됩니다:

  • FP8: Dynamic per-channel weights 및 per-token activations.
  • FP4: NVFP4 및 MXFP4 버전이 GPTQ를 통해 양자화되었습니다.
  • GGUF: llama.cpp를 통해 제공되는 다양한 포맷(Q8_0부터 Q2_K까지).

Performance Results

평가 결과, 추론 능력은 모델 크기에 따라 확장됩니다. 30B 모델은 agentic coding 분야에서 앞서가며, SWE Bench Verified에서 57.00을, Terminal-Bench 2.1에서 29.24를 달성했습니다. AIME25와 같은 reasoning benchmarks는 78.33 (3B)에서 89.17 (30B)로 발전하는 양상을 보합니다. 모든 모델은 English, German, Spanish, French, Japanese, Portuguese, Arabic, Czech, Italian, Korean, Dutch, 및 Chinese를 포함한 12개 언어를 지원합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트