Qwen2-Math 發布說明

Qwen 推出了 Qwen2-Math,一系列專門設計用於解決複雜算術與數學問題的大型語言模型。旗艦模型 Qwen2-Math-72B-Instruct 展示了最先進的表現,在關鍵數學基準測試中超越了 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 與 Llama-3.1-405B 等專有模型。

模型架構與訓練

Qwen2-Math 模型基於 Qwen2 基礎構建,提供三種規模:1.5B、7B 與 72B。開發流程分為兩個主要階段:

基礎模型預訓練

基礎模型從 Qwen2 初始化,並在專門的數學語料庫上進行預訓練。此資料集包括:

  • 高品質的數學網路文本與書籍。
  • 程式碼與考題。
  • 由 Qwen2 合成的數學預訓練資料。

指令微調

為了製作 Instruct 版本,Qwen 基於 Qwen2-Math-72B 開發了數學專用的獎勵模型。訓練管線使用:

  • Rejection Sampling:結合密集獎勵訊號與二元正確性訊號,以構建監督式微調(SFT)資料。
  • Reinforcement Learning:在 SFT 階段之後實施群組相對策略最佳化(GRPO)。

效能與評估

Qwen2-Math 在廣泛的英語與中文基準測試中進行評估,以測試一般與競賽等級的數學能力。

一般數學基準測試

模型在 GSM8K、Math 與 MMLU-STEM 上進行測試。對於 Instruct 模型,使用 Greedy、Maj@8 與 RM@8(獎勵模型)設定來衡量效能。結果顯示 RM@8 超過 Maj@8,尤其在 1.5B 與 7B 模型上,驗證了數學獎勵模型的有效性。

競賽等級數學

Qwen2-Math-Instruct 在高度具挑戰性的資料集上進行測試,包括:

  • 英文:OlympiadBench、CollegeMath、AIME 2024 與 AMC 2023。
  • 中文:高考(2024)、CN 中學 24 與 CMATH。

在如 AIME 2024 與 AMC 2023 等複雜競賽評估中,模型在 Greedy、Maj@64、RM@64 與 RM@256 設定下展現出強勁的表現。

資料去污

為確保基準測試的完整性,Qwen 對預訓練與後訓練資料集皆採用了嚴格的去污方法:

  • Exact Match:移除測試集中的相同樣本。
  • 13-gram Deduplication:移除最長公共序列比例超過 0.6 的樣本。
  • Targeted Filtering:從包括 GSM8K、MATH、Aqua、SAT Math、OlympiadBench、College Math、AIME24 與 AMC23 等資料集中移除受污染的樣本。

目前限制與路線圖

Qwen2-Math 目前主要支援英語。實驗室已宣布將發布雙語模型(英語與中文),並正在開發多語言模型,以進一步擴大可及性與能力。

Sources