IBM Granite 4.1 LLMs 發行說明 / 技術概覽
IBM Granite 4.1 LLMs 發行說明 / 技術概覽
模型架構
Granite 4.1 模型採用僅解碼器密集 Transformer 架構。所有三種模型規模(3B、8B 和 30B)共享相同的訓練管線和資料策略,僅在其特定的架構維度上有所不同。
關鍵架構組件包括:
- 分組查詢注意力 (GQA)
- 旋轉位置嵌入 (RoPE)
- SwiGLU 激活函數
- RMSNorm
- 共享輸入/輸出嵌入
| 組件 | 3B Dense | 8B Dense | 30B Dense |
|---|---|---|---|
| 嵌入大小 | 2560 | 4096 | 4096 |
| 層數 | 40 | 40 | 64 |
| 注意力頭大小 | 64 | 128 | 128 |
| 注意力頭數量 | 40 | 32 | 32 |
| KV頭數量 | 8 | 8 | 8 |
| MLP 隱藏層大小 | 8192 | 12800 | 32768 |
| MLP 激活函數 | SwiGLU | SwiGLU | SwiGLU |
| 位置嵌入 | RoPE | RoPE | RoPE |
五階段預訓練策略
模型從零開始在約15兆個標記上進行訓練,採用五階段策略,逐步從廣泛的網頁規模數據轉向高度策劃的特定領域內容。
第一階段:通用預訓練
此階段使用10兆個標記建立基礎語言理解。數據組成主要為 CommonCrawl(約59%),其次為 Code(約20%)、Technical(約10.5%)、Math(約7%)和 Multilingual(約2%)。
第二階段:數學與程式碼重點
第二階段透過增加數學和程式碼數據的比例來提升推理能力。混合數據包括 Math(約35%)、Code(約30%)、CommonCrawl-HQ(約12%)、Technical(約10%)、Synthetic(約9%)和 Multilingual(約3%)。
第三及第四階段:高品質數據退火
這些中期訓練階段專注於高品質數據混合,並引入了思維鏈和合成指令數據。
- 第三階段(2T 標記): 混合 CommonCrawl-HQ、Math、Code、Technical、Synthetic、長思維鏈以及語言/程式碼指令。
- 第四階段(0.5T 標記): 進一步以最高品質數據為重點精煉模型,其中 CommonCrawl-HQ 的權重為 40%、Code 為 20%、Math 為 20%。
第五階段:長上下文訓練 (LCE)
最終階段透過分階段擴展過程(32K、128K,最後 512K)將上下文視窗從 4K 擴展至 512K 個標記。8B 和 30B 模型的 512K 擴展使用 80% 書籍和 20% 程式碼倉儲數據的混合。為防止短上下文效能下降,會在每個 LCE 階段後執行模型合併。
監管微調 (SFT) 與品質控管
Granite 4.1 模型使用約 410 萬個高品質樣本進行 SFT。為確保資料完整性,IBM 同時採用 LLM-as-Judge 框架和基於規則的過濾。
LLM-as-Judge 框架
該框架在六個加權維度上評估助手回應:指令遵循、正確性、完整性、簡潔性、自然性和校準。評判者會忽略系統提示、使用者輸入和檢索到的文件,專注於模型的回應。對於幻覺、錯誤前提或錯誤計算等關鍵缺陷,會套用硬拒絕規則。
SFT 訓練配置
- 計算: 16 個節點,每節點 4x GB200
- 週期: 3
- 序列長度: 16,384 個標記
- 有效批次大小: 256 個樣本/迭代
多階段強化學習 (RL)
SFT 之後,模型會經歷多階段強化學習管線,以優化特定能力同時將災難性遺忘降至最低。
訓練方法論
模型使用 On-policy GRPO(群組相對政策優化) 並搭配 DAPO(解耦裁剪與動態取樣政策優化)損失。該管線由四個依序階段組成:
- 多領域 RL: 聯合訓練數學、科學、邏輯、指令遵循、結構化輸出、Text2SQL、時間推理和一般聊天。
- RLHF(來自人類回饋的強化學習): 使用多語言標量獎勵模型來提升有用性和對話品質。
- 身份與知識校準 RL: 一個短階段(約 40 步)以提升自我識別能力。
- 數學 RL: 一個目標階段,以恢復並在 RLHF 階段中遺失的數學推理效能。
效能與基準測試
Granite 4.1 模型在通用、數據、程式碼和多語言任務上表現出強大的效能。一個顯著的發現是,Granite 4.1-8B 密集模型在幾個關鍵基準測試中匹配或超越前一代的 Granite 4.0-H-Small (32B-A9B MoE),包括 IFEval、AlpacaEval、MMLU-Pro 和 GSM8K。
關鍵指令模型基準測試
| 基準測試 | 3B | 8B | 30B |
|---|---|---|---|
| MMLU (5-shot) | 67.02 | 73.84 | 80.16 |
| GSM8K (8-shot) | 86.88 | 92.49 | 94.16 |
| HumanEval (pass@1) | 79.27 | 87.20 | 89.63 |
| AlpacaEval 2.0 | 38.57 | 50.08 | 56.16 |
| BFCL v3 | — | 68.27 | 73.68 |
部署與基礎設施
Granite 4.1 模型根據 Apache 2.0 授權 發布。為了高效推理,提供 FP8 量化變體,相較於 16-bit 精度,可將磁碟占用和 GPU 記憶體使用量減少約 50%。
訓練在 CoreWeave 上的 NVIDIA GB200 NVL72 叢集 進行,利用 72-GPU NVLink 域進行機架內通訊,以及使用非阻塞 Fat-Tree NDR 400 Gb/s InfiniBand 網路進行機架間通訊。