Qwen2.5-Math 发布说明
Qwen 宣布发布 Qwen2.5-Math,这是一个专门用于高精度英汉双语推理的数学大型语言模型(LLM)系列。该系列在链式思考(Chain-of-Thought,CoT)之外引入了工具集成推理(Tool-Integrated Reasoning,TIR),以提升计算准确性并解决复杂算法任务,使旗舰 72B 模型成为领先的开源数学 LLM。
模型阵容与能力
Qwen2.5-Math 提供多种配置,以在性能和效率之间取得平衡:
- Base Models: Qwen2.5-Math-1.5B、7B 和 72B。
- Instruction-Tuned Models: Qwen2.5-Math-1.5B-Instruct、7B-Instruct 和 72B-Instruct。
- Reward Model: Qwen2.5-Math-RM-72B,用于数据构建和强化学习。
虽然之前的 Qwen2-Math 系列侧重于英文 CoT,Qwen2.5-Math 将支持扩展至 中文和英文,并引入 Tool-Integrated Reasoning (TIR)。TIR 使模型能够使用工具(例如 Python 解释器)进行精确计算和符号操作,克服 CoT 在处理矩阵特征值或二次方程根等复杂计算时的固有局限。
技术改进与训练流水线
Qwen2.5-Math 模型通过对 Qwen2-Math 基础模型进行升级,采用以下三种主要方法进行开发:
- Synthesized Data: 使用 Qwen2-Math-72B-Instruct 生成高质量的数学预训练数据。
- Expanded Corpus: 汇集更多来自书籍、网络资源和代码的高质量数学数据,特别是增加中文数据。Qwen Math Corpus v2 从 700B 扩展至超过 1T token。
- Parameter Initialization: 利用 Qwen2.5 系列基础模型提升语言理解和代码生成能力。
对于指令微调模型,Qwen 使用了数学专用奖励模型(Qwen2.5-Math-RM-72B)通过拒绝采样构建监督微调(Supervised Fine-Tuning,SFT)数据,并使用组相对策略优化(Group Relative Policy Optimization,GRPO)来指导强化学习。
性能基准
Qwen2.5-Math 相较于前代模型表现出显著提升,并可与领先的闭源模型竞争:
通用数学
- Flagship Performance: Qwen2.5-Math-72B-Instruct 在英文上平均提升 4.4 分,中文上提升 6.1 分,超越 Qwen2-Math-72B-Instruct。
- TIR Advantage: 在 TIR 设置(RM@8)下,72B-Instruct 模型在 MATH 基准上取得 92.9 分。
- Efficiency: Qwen2.5-Math-7B-Instruct 在性能上超过了之前的 Qwen2-Math-Instruct 72B, 在 MATH 上分别取得 83.6(CoT)和 85.3(TIR)分。
- Small Model Capability: 1.5B-Instruct 模型在使用 Python 解释器时,MATH 分数约为 80。
复杂竞赛数学
在 AIME 2024 基准测试中,闭源模型如 Claude 3 Opus、GPT-4 Turbo 和 Gemini 1.5 Pro 仅解出 30 题中的 1 或 2 题,而 Qwen2.5-Math-72B-Instruct 在 Greedy CoT 模式下解出 9 题,在 TIR 模式下解出 12 题。借助奖励模型,7B-Instruct 模型最多可解出 21 题。
评估完整性与去污
为防止数据泄漏并确保结果公正,Qwen 实施了严格的去污流程:
- 13-gram Matching: 在文本归一化后,用于排除可能受污染的训练样本。
- Longest Common Subsequence (LCS): 当比例超过 0.6 时视为污染,尤其针对常见数学表达式。
- Dataset Filtering: 将样本与包括 GSM8K、MATH、Minerva Math、Olympiad Bench、AIME 24 等在内的众多测试集进行过滤。
实现与演示
Qwen 提供两种主要方式来体验模型:
- TIR Demo: 已集成到 Qwen-Agent,用户可在本地运行代码以使用工具集成推理。
- Multi-modal Demo: 在 Hugging Face 和 Modelscope 上提供,结合 Qwen2-VL 进行 OCR,Qwen2-Math 进行推理,以处理数学问题的图像、文本或草图。
SUMMARY: Qwen 已发布 Qwen2.5-Math,这是一系列支持双语推理和工具集成推理(TIR)的开源数学 LLM,能够在复杂数学基准上超越领先的闭源模型。
TITLE: Qwen2.5-Math 发布说明