IBM Granite 4.1 LLMs 發行說明 / 技術概覽

IBM Granite 4.1 LLMs 發行說明 / 技術概覽

模型架構

Granite 4.1 模型採用僅解碼器密集 Transformer 架構。所有三種模型規模(3B、8B 和 30B)共享相同的訓練管線和資料策略,僅在其特定的架構維度上有所不同。

關鍵架構組件包括:

  • 分組查詢注意力 (GQA)
  • 旋轉位置嵌入 (RoPE)
  • SwiGLU 激活函數
  • RMSNorm
  • 共享輸入/輸出嵌入
組件 3B Dense 8B Dense 30B Dense
嵌入大小 2560 4096 4096
層數 40 40 64
注意力頭大小 64 128 128
注意力頭數量 40 32 32
KV頭數量 8 8 8
MLP 隱藏層大小 8192 12800 32768
MLP 激活函數 SwiGLU SwiGLU SwiGLU
位置嵌入 RoPE RoPE RoPE

五階段預訓練策略

模型從零開始在約15兆個標記上進行訓練,採用五階段策略,逐步從廣泛的網頁規模數據轉向高度策劃的特定領域內容。

第一階段:通用預訓練

此階段使用10兆個標記建立基礎語言理解。數據組成主要為 CommonCrawl(約59%),其次為 Code(約20%)、Technical(約10.5%)、Math(約7%)和 Multilingual(約2%)。

第二階段:數學與程式碼重點

第二階段透過增加數學和程式碼數據的比例來提升推理能力。混合數據包括 Math(約35%)、Code(約30%)、CommonCrawl-HQ(約12%)、Technical(約10%)、Synthetic(約9%)和 Multilingual(約3%)。

第三及第四階段:高品質數據退火

這些中期訓練階段專注於高品質數據混合,並引入了思維鏈和合成指令數據。

  • 第三階段(2T 標記): 混合 CommonCrawl-HQ、Math、Code、Technical、Synthetic、長思維鏈以及語言/程式碼指令。
  • 第四階段(0.5T 標記): 進一步以最高品質數據為重點精煉模型,其中 CommonCrawl-HQ 的權重為 40%、Code 為 20%、Math 為 20%。

第五階段:長上下文訓練 (LCE)

最終階段透過分階段擴展過程(32K、128K,最後 512K)將上下文視窗從 4K 擴展至 512K 個標記。8B 和 30B 模型的 512K 擴展使用 80% 書籍和 20% 程式碼倉儲數據的混合。為防止短上下文效能下降,會在每個 LCE 階段後執行模型合併。

監管微調 (SFT) 與品質控管

Granite 4.1 模型使用約 410 萬個高品質樣本進行 SFT。為確保資料完整性,IBM 同時採用 LLM-as-Judge 框架和基於規則的過濾。

LLM-as-Judge 框架

該框架在六個加權維度上評估助手回應:指令遵循、正確性、完整性、簡潔性、自然性和校準。評判者會忽略系統提示、使用者輸入和檢索到的文件,專注於模型的回應。對於幻覺、錯誤前提或錯誤計算等關鍵缺陷,會套用硬拒絕規則。

SFT 訓練配置

  • 計算: 16 個節點,每節點 4x GB200
  • 週期: 3
  • 序列長度: 16,384 個標記
  • 有效批次大小: 256 個樣本/迭代

多階段強化學習 (RL)

SFT 之後,模型會經歷多階段強化學習管線,以優化特定能力同時將災難性遺忘降至最低。

訓練方法論

模型使用 On-policy GRPO(群組相對政策優化) 並搭配 DAPO(解耦裁剪與動態取樣政策優化)損失。該管線由四個依序階段組成:

  1. 多領域 RL: 聯合訓練數學、科學、邏輯、指令遵循、結構化輸出、Text2SQL、時間推理和一般聊天。
  2. RLHF(來自人類回饋的強化學習): 使用多語言標量獎勵模型來提升有用性和對話品質。
  3. 身份與知識校準 RL: 一個短階段(約 40 步)以提升自我識別能力。
  4. 數學 RL: 一個目標階段,以恢復並在 RLHF 階段中遺失的數學推理效能。

效能與基準測試

Granite 4.1 模型在通用、數據、程式碼和多語言任務上表現出強大的效能。一個顯著的發現是,Granite 4.1-8B 密集模型在幾個關鍵基準測試中匹配或超越前一代的 Granite 4.0-H-Small (32B-A9B MoE),包括 IFEval、AlpacaEval、MMLU-Pro 和 GSM8K。

關鍵指令模型基準測試

基準測試 3B 8B 30B
MMLU (5-shot) 67.02 73.84 80.16
GSM8K (8-shot) 86.88 92.49 94.16
HumanEval (pass@1) 79.27 87.20 89.63
AlpacaEval 2.0 38.57 50.08 56.16
BFCL v3 68.27 73.68

部署與基礎設施

Granite 4.1 模型根據 Apache 2.0 授權 發布。為了高效推理,提供 FP8 量化變體,相較於 16-bit 精度,可將磁碟占用和 GPU 記憶體使用量減少約 50%。

訓練在 CoreWeave 上的 NVIDIA GB200 NVL72 叢集 進行,利用 72-GPU NVLink 域進行機架內通訊,以及使用非阻塞 Fat-Tree NDR 400 Gb/s InfiniBand 網路進行機架間通訊。

Sources