IBM Granite 4.1 LLMs 릴리스 노트 / 기술 개요

IBM Granite 4.1 LLMs 릴리스 노트 / 기술 개요

IBM은 3B, 8B, 30B 파라미터 변형으로 구성된 밀집형, 디코더 전용 Large Language Models(LLM) 가족인 Granite 4.1을 출시했습니다. 이러한 모델은 약 15조 토큰으로 훈련되며, 수학, 코딩 및 instruction following에서 높은 성능을 달성하기 위해 다단계 사전 훈련 및 강화 학습 파이프라인을 활용합니다. 특히 8B 모델은 더 큰 Mixture-of-Experts(MoE) 아키텍처와匹配하거나 이를 초과합니다.

모델 아키텍처

Granite 4.1 모델은 디코더 전용 밀집 트랜스포머 아키텍처를 사용합니다. 세 가지 모델 크기(3B, 8B, 30B)는 동일한 훈련 파이프라인과 데이터 전략을 공유하며, 특정 아키텍처 차원만 다릅니다.

주요 아키텍처 구성 요소는 다음과 같습니다:

  • 그룹드 쿼리 어텐션 (GQA)
  • 회전 위치 임베딩 (RoPE)
  • SwiGLU 활성화
  • RMSNorm
  • 공유 입력/출력 임베딩
구성 요소 3B 밀집 8B 밀집 30B 밀집
임베딩 크기 2560 4096 4096
층 수 40 40 64
어텐션 헤드 크기 64 128 128
어텐션 헤드 수 40 32 32
KV 헤드 수 8 8 8
MLP 은닉 크기 8192 12800 32768
MLP 활성화 SwiGLU SwiGLU SwiGLU
위치 임베딩 RoPE RoPE RoPE

5단계 사전 훈련 전략

이 모델들은 약 15조 토큰으로 처음부터 훈련되며, 광범위한 웹 규모 데이터에서 고도로 큐레이션된 도메인 특화 콘텐츠로 점진적으로 이동하는 5단계 전략을 사용합니다.

1단계: 일반 사전 훈련

이 단계는 10조 토큰을 사용하여 기초 언어 이해를 구축합니다. 데이터 구성은 주로 CommonCrawl(59%), 그 다음 Code(20%), Technical(10.5%), Math(7%), Multilingual(~2%) 순입니다.

2단계: 수학 및 코드 집중

2단계는 수학 및 프로그래밍 데이터 비율을 증가시켜 추론 능력을 향상시킵니다. 혼합물에는 Math(35%), Code(30%), CommonCrawl-HQ(12%), Technical(10%), Synthetic(9%), Multilingual(3%)가 포함됩니다.

3단계 및 4단계: 고품질 데이터 어닐링

이 중반 훈련 단계는 고품질 데이터 혼합물에 초점을 맞추며, 사고사슬(chain-of-thought)과 합성 지시 데이터 소개를 포함합니다.

  • 3단계 (2T 토큰): CommonCrawl-HQ, Math, Code, Technical, Synthetic, Long Chain-of-Thought, Language/Code Instructions를 혼합합니다.
  • 4단계 (0.5T 토큰): 최고 품질의 데이터에 중점을 두고 모델을 더욱 정제하며, CommonCrawl-HQ(40%), Code(20%), Math(20%)에 크게 가중치를 둡니다.

5단계: Long Context Training (LCE)

최종 단계는 staged extension 과정(32K, 128K, 마지막으로 512K)을 통해 컨텍스트 윈도우를 4K에서 512K 토큰으로 확장합니다. 8B 및 30B 모델의 512K 확장은 80% 책과 20% 코드 저장소 데이터 혼합물을 사용합니다. 짧은 컨텍스트 성능 저하를 방지하기 위해 각 LCE 단계 후에 모델 병합이 수행됩니다.

지도 미세 조정(SFT) 및 품질 관리

Granite 4.1 모델은 약 410만 개의 고품질 샘플을 사용하여 SFT를 거칩니다. 데이터 무결성을 보장하기 위해 IBM은 규칙 기반 필터링과 함께 LLM-as-Judge 프레임워크를 사용합니다.

LLM-as-Judge 프레임워크

이 프레임워크는 가중치가 부여된 여섯 가지 차원(지시 따르기, 정확성, 완전성, 간결성, 자연스러움, 보정)에서 어시스턴트 응답을 평가합니다. 판사는 시스템 프롬프트, 사용자 입력, 검색된 문서를 무시하고 모델의 응답에strictly 집중합니다. 환각, 잘못된 전제, 잘못된 계산과 같은 중대한 결함에 대해 하드-거절 규칙이 적용됩니다.

SFT 훈련 구성

  • 컴퓨팅: 16개 노드, 노드당 4x GB200
  • 에포크: 3
  • 시퀀스 길이: 16,384 토큰
  • 유효 배치 크기: 256 샘플/iter

다단계 강화 학습(RL)

SFT 후, 모델은 katastrofic forgetting을 최소화하면서 특정 능력을 최적화하기 위해 다단계 RL 파이프라인을 거칩니다.

훈련 방법론

모델은 **On-policy GRPO(Group Relative Policy Optimization)**와 DAPO(Decoupled Clip and Dynamic sAmpling Policy Optimization) 손실을 사용합니다. 파이프라인은 네 개의 순차적 단계로 구성됩니다:

  1. 멀티도메인 RL: 수학, 과학, 논리, instruction following, 구조화된 출력, Text2SQL, 시간적 추론, 일반 채팅에서의 공동 훈련.
  2. RLHF(인간 피드백으로부터의 강화 학습): 다언어 스칼라 보상 모델을 사용하여 유용성과 대화 품질을 향상시킵니다.
  3. 정체성 및 지식-보정 RL: 자기 식별 능력을 향상시키기 위한 짧은 단계(~40 단계).
  4. 수학 RL: RLHF 단계에서 손실된 수학적 추론 성능을 회복하고 향상시키기 위한 대상 단계.

성능 및 벤치마크

Granite 4.1 모델은 일반, 수학, 코딩, 다국어 작업에서 강력한 성능을 보여줍니다. 주목할 만한 발견은 Granite 4.1-8B 밀집 모델이 IFEval, AlpacaEval, MMLU-Pro, GSM8K과 같은 주요 벤치마크에서 이전 세대의 **Granite 4.0-H-Small (32B-A9B MoE)**와匹配하거나 이를 초과한다는 것입니다.

주요 Instruct 모델 벤치마크

벤치마크 3B 8B 30B
MMLU (5-shot) 67.02 73.84 80.16
GSM8K (8-shot) 86.88 92.49 94.16
HumanEval (pass@1) 79.27 87.20 89.63
AlpacaEval 2.0 38.57 50.08 56.16
BFCL v3 68.27 73.68

배포 및 인프라

Granite 4.1 모델은 Apache 2.0 라이선스 하에 출시됩니다. 효율적인 추론을 위해 FP8 양자화 변형을 사용할 수 있으며, 이는 16비트 정밀도 대비 디스크 footprint와 GPU 메모리 사용량을 약 50% 줄입니다.

훈련은 CoreWeave에서 호스팅되는 NVIDIA GB200 NVL72 클러스터에서 수행되었으며, 랙 내 통신을 위해 72-GPU NVLink 도메인을 사용하고, 랙 간 통신을 위해 비차단 Fat-Tree NDR 400 Gb/s InfiniBand 네트워크를 활용했습니다.

Sources