Qwen2.5-Math 版本說明

Qwen 宣布發布 Qwen2.5-Math,這是一系列專門的數學大型語言模型(LLMs),旨在提供英語與中文的高精度推理。該系列同時引入工具整合推理(TIR)與思考鏈(CoT),以提升計算精度並解決複雜的演算法任務,將旗艦 72B 模型定位為領先的開源數學 LLM。

模型陣容與能力

Qwen2.5-Math 提供多種配置,以平衡效能與效率:

  • Base Models(基礎模型):Qwen2.5-Math-1.5B、7B 與 72B。
  • Instruction-Tuned Models(指令微調模型):Qwen2.5-Math-1.5B-Instruct、7B-Instruct 與 72B-Instruct。
  • Reward Model(獎勵模型):Qwen2.5-Math-RM-72B,用於資料建構與強化學習。

雖然先前的 Qwen2-Math 系列僅聚焦於英語 CoT,Qwen2.5-Math 擴展支援 中文與英文,並引入 工具整合推理(TIR)。TIR 允許模型使用工具(例如 Python 直譯器)進行精確計算與符號操作,解決 CoT 在處理諸如矩陣特徵值或二次方程根等複雜計算時的固有限制。

技術改進與訓練流程

Qwen2.5-Math 模型透過三種主要方法升級 Qwen2-Math 基礎模型而開發:

  1. Synthesized Data(合成資料):使用 Qwen2-Math-72B-Instruct 產生高品質的數學預訓練資料。
  2. Expanded Corpus(擴充語料庫):彙集更多來自書籍、網路資源與程式碼的高品質數學資料,特別增加中文資料。Qwen Math Corpus v2 從 700B 增長至超過 1T 代幣。
  3. Parameter Initialization(參數初始化):利用 Qwen2.5 系列基礎模型,以提升語言理解與程式碼生成能力。

對於指令微調模型,Qwen 使用了針對數學的獎勵模型(Qwen2.5-Math-RM-72B)透過拒絕抽樣構建監督式微調(SFT)資料,並以群組相對策略優化(GRPO)指導強化學習。

效能基準測試

Qwen2.5-Math 展示出相較前代顯著的提升,且能與領先的封閉源模型競爭:

一般數學

  • Flagship Performance(旗艦效能):Qwen2.5-Math-72B-Instruct 在英語上平均領先 Qwen2-Math-72B-Instruct 4.4 分,中文上領先 6.1 分。
  • TIR Advantage(TIR 優勢):在 TIR 設定(RM@8)下,72B-Instruct 模型於 MATH 基準取得 92.9 分。
  • Efficiency(效率):Qwen2.5-Math-7B-Instruct 在效能上超越先前的 Qwen2-Math-Instruct 72B,取得 MATH 分數 83.6(CoT)與 85.3(TIR)。
  • Small Model Capability(小模型能力):1.5B-Instruct 模型在使用 Python 直譯器時,MATH 分數約為 80。

複雜競賽數學

在 AIME 2024 基準測試中,封閉源模型如 Claude 3 Opus、GPT-4 Turbo 與 Gemini 1.5 Pro 只解出 30 題中的 1 或 2 題,Qwen2.5-Math-72B-Instruct 在貪婪 CoT 模式下解出 9 題,在 TIR 模式下解出 12 題。透過獎勵模型協助,7B-Instruct 模型最高可解出 21 題。

評估完整性與去污染

為防止資料外洩並確保結果無偏,Qwen 實施了嚴格的去污染流程:

  • 13-gram Matching(13-gram 匹配):在文字正規化後,用於排除可能受污染的訓練樣本。
  • Longest Common Subsequence (LCS)(最長公共子序列):比例超過 0.6 時即視為污染,特別針對常見的數學表達式。
  • Dataset Filtering(資料集過濾):將樣本對照多種測試集過濾,包括 GSM8K、MATH、Minerva Math、Olympiad Bench、以及 AIME 24 等。

實作與示範

Qwen 提供兩種主要方式體驗模型:

  • TIR Demo(TIR 示範):整合於 Qwen-Agent,允許使用者在本機執行程式碼以使用工具整合推理。
  • Multi-modal Demo(多模態示範):於 Hugging Face 與 Modelscope 提供,結合 Qwen2-VL 進行 OCR 與 Qwen2-Math 進行推理,以處理圖像、文字或手繪的數學問題。

Sources