IBM Granite 4.2 Release Notes
IBM은 3B, 8B, 및 30B 파라미터 크기로 제공되는 밀집형(dense), decoder-only 추론 LLM 제품군인 Granite 4.2를 출시했습니다. 이 모델들은 명시적 추론을 위해 설계되었으며, thinking, non-thinking, 및 low-effort 모드 사이를 전환할 수 있는 chain-of-thought 프로세스를 지원하며, Apache 2.0 라이선스 하에 출시되었습니다.
Model Architecture and Pre-training
Granite 4.2 모델은 decoder-only 밀집형 transformer 아키텍처를 사용합니다. 주요 기술 사양에는 40개의 attention heads와 8개의 KV heads를 갖춘 Grouped Query Attention (GQA), θ = 10,000,000인 Rotary Position Embedding (RoPE), 그리고 MLP의 SwiGLU 활성화 함수가 포함됩니다. 모델은 bfloat16 정밀도로 학습되었습니다.
| Component | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| Embedding size | 2560 | 4096 | 4096 |
| Number of layers | 40 | 40 | 64 |
| Attention head size | 64 | 128 | 128 |
| Number of attention heads | 40 | 32 | 32 |
| Number of KV heads | 8 | 8 | 8 |
| MLP hidden size | 8192 | 12800 | 32768 |
| Sequence length | 131,072 | 131,072 | 131,072 |
사전 학습(Pre-training)은 5단계 전략을 사용하여 약 15 trillion tokens에 대해 처음부터 수행되었습니다. 이 프로세스는 기초 사전 학습, data annealing을 포함한 mid-training, 그리고 컨텍스트 윈도우를 512K tokens까지 확장하는 최종 단계로 구성됩니다.
Supervised Fine-Tuning (SFT)
SFT는 약 720만 개의 샘플(약 100B tokens)을 혼합하여 기본 모델을 지시사항 준수 및 추론 어시스턴트로 변환합니다. 데이터는 다음과 같이 나뉩니다:
- Agentic Corpus (31.6%): 소프트웨어 엔지니어링(69%), tool calling(12.1%), terminal use(8.0%), math(3.5%), search(0.8%), 및 action(0.2%)에 집중합니다.
- Non-Agentic Corpus (68.4%): 지시사항 준수(18.8%), coding(18.8%), math(14.6%), 다국어(7.0%), science(5.4%), reasoning(3.0%), 및 safety(0.8%)를 포함합니다.
품질 관리는 OpenAI Chat format으로의 정규화, GPT-OSS-120B 및 Gemma 4를 통한 LLM 기반 판정, 그리고 SHA-256 기반의 중복 제거를 포함했습니다. 30B 모델은 agentic coding을 위해 특별히 설계된 추가적인 두 번째 SFT 단계를 거쳤으며, SWE 및 coding 데이터의 upsampling을 위해 한 번의 추가 epoch를 수행했습니다.
Multi-Stage Reinforcement Learning Pipeline
Granite 4.2는 **asynchronous Group Relative Policy Optimization (GRPO)**를 사용하는 다단계 RL 파이프라인을 채택합니다. 이 방법은 별도의 value network가 필요 없는 leave-one-out baseline을 사용합니다. 파이프라인은 각 단계의 policy가 다음 단계의 base가 되는 warm-starts의 시퀀스입니다.
Foundational RL
모든 모델 크기는 다음과 같은 기초 RL을 거칩니다:
- RLVR (Verifiable-Reward RL): 가장 광범위한 단계로, math(Lean formal proving 포함), competitive coding, STEM MCQA, 지시사항 준수, 및 reasoning puzzles를 다룹니다. RLVR은 3B/8B 모델에서 두 라운드, 30B 모델에서 세 라운드 진행됩니다.
- Skill Boosters: 지시사항 준수(multi-turn chat, structured outputs) 및 competitive coding을 날카롭게 다듬는 타겟팅된 실행입니다.
Agentic RL (8B and 30B only)
8B 및 30B 모델은 실제 환경에서 tool interaction을 학습하기 위해 추가적인 agentic block을 거칩니다:
- SWE Agent: OpenHands harness를 사용하여 sandboxed repositories에서 code를 편집하고 test를 실행하며, hidden tests가 통과하는지에 따라 보상을 받습니다.
- Terminal Agent: Terminus-2 harness를 통해 live shell에서 작동하며, rollouts는 최대 64 environment turns에 이릅니다.
- Search Agent: live web-search tools를 사용하여 multi-hop research를 수행하며, LLM judge에 의해 보상을 받습니다.
Alignment (RLHF)
모든 모델은 인간의 선호도와 안전성을 위해 generative reward model (GenRM) 및 safety reward를 활용한 RLHF로 마무리됩니다. 이 단계에서는 또한 장황함을 줄이기 위해 reasoning-length penalty를 reasoning-length penalty를 적용합니다. \n## Infrastructure and Deployment
학습은 NVIDIA GB200 NVL72 클러스터에서 수행되었습니다. 소프트웨어 스택은 GRPO 루프를 위한 NeMo-RL 및 rollouts를 조율하고 sandboxed resources를 호스트하는 NeMo-Gym을 사용합니다.
Quantization and Serving
vLLM 추론을 위한 네 가지 양자화된 변형이 제공됩니다:
- FP8: Dynamic per-channel weights 및 per-token activations.
- FP4: NVFP4 및 MXFP4 버전이 GPTQ를 통해 양자화되었습니다.
- GGUF: llama.cpp를 통해 제공되는 다양한 포맷(Q8_0부터 Q2_K까지).
Performance Results
평가 결과, 추론 능력은 모델 크기에 따라 확장됩니다. 30B 모델은 agentic coding 분야에서 앞서가며, SWE Bench Verified에서 57.00을, Terminal-Bench 2.1에서 29.24를 달성했습니다. AIME25와 같은 reasoning benchmarks는 78.33 (3B)에서 89.17 (30B)로 발전하는 양상을 보합니다. 모든 모델은 English, German, Spanish, French, Japanese, Portuguese, Arabic, Czech, Italian, Korean, Dutch, 및 Chinese를 포함한 12개 언어를 지원합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 프로젝트