Qwen2-Math 发布说明
Qwen 已推出 Qwen2-Math,一系列专门用于解决复杂算术和数学问题的大型语言模型。旗舰模型 Qwen2-Math-72B-Instruct 展示了业界领先的性能,在关键数学基准测试中超越了 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B 等专有模型。
模型架构与训练
Qwen2-Math 模型基于 Qwen2 基础,提供三种规模:1.5B、7B 和 72B。开发过程包括两个主要阶段:
基础模型预训练
基础模型从 Qwen2 初始化,并在专门的数学语料库上进行预训练。该数据集包括:
- 高质量的数学网页文本和书籍。
- 代码和考试题目。
- 由 Qwen2 合成的数学预训练数据。
指令微调
为了创建 Instruct 版本,Qwen 基于 Qwen2-Math-72B 开发了一个针对数学的奖励模型。训练流水线使用:
- 拒绝采样:将密集奖励信号与二进制正确性信号相结合,以构建监督微调(SFT)数据。
- 强化学习:在 SFT 阶段后实现组相对策略优化(GRPO)。
性能与评估
Qwen2-Math 在大量英汉基准测试中进行评估,以检验通用数学和竞赛级数学的表现。
通用数学基准
模型在 GSM8K、Math 和 MMLU-STEM 上进行测试。对于 Instruct 模型,使用 Greedy、Maj@8 和 RM@8(奖励模型)设置进行性能测量。结果表明,RM@8 优于 Maj@8,尤其在 1.5B 和 7B 模型中,验证了数学奖励模型的有效性。
竞赛级数学
Qwen2-Math-Instruct 在高度挑战性的数据集上进行测试,包括:
- 英文:OlympiadBench、CollegeMath、AIME 2024 和 AMC 2023。
- 中文:高考(2024)、CN 中学 24 和 CMATH。
在诸如 AIME 2024 和 AMC 2023 等复杂竞赛评估中,模型在 Greedy、Maj@64、RM@64 和 RM@256 设置下表现出强劲的性能。
数据去污
为确保基准测试的完整性,Qwen 对预训练和后训练数据集采用了严格的去污方法:
- 完全匹配:删除测试集中的相同样本。
- 13-gram 去重:删除最长公共序列比例超过 0.6 的样本。
- 针对性过滤:从包括 GSM8K、MATH、Aqua、SAT Math、OlympiadBench、College Math、AIME24 和 AMC23 在内的数据集中删除受污染的样本。
当前局限性与路线图
Qwen2-Math 目前主要支持英文。实验室已宣布计划发布双语模型(英文和中文),并正在开发多语言模型,以进一步提升可访问性和能力。
Sources
- OriginalIntroducing Qwen2-Math