Qwen2.5-Math-PRM 和 ProcessBench 发布

Qwen 发布了两个新的过程奖励模型(PRM),Qwen2.5-Math-PRM-7BQwen2.5-Math-PRM-72B,以及一个名为 ProcessBench 的新评估基准。这些发布旨在通过识别和缓解中间推理步骤中的错误,而不是仅仅依赖最终答案,来提高大型语言模型(LLM)在数学推理中的可靠性。

ProcessBench:逐步评估基准

ProcessBench 旨在衡量模型识别数学推理中错误步骤的确切位置的能力。与传统的响应级评估不同,ProcessBench 专注于逐步验证解决方案。

  • 数据集组成:该基准包含 3,400 个测试用例,主要集中在竞赛和奥林匹克级别的数学。
  • 注释:每个测试用例包含一个人类专家标注了错误位置的逐步解决方案。
  • 任务:模型根据其识别包含错误的最早步骤或正确得出整个解决方案正确的结论的能力进行评估。
  • 适用性:该基准可用于评估 PRM 和通用的“批评”模型(其中通用 LLMs 被提示逐步批评解决方案)。

Qwen2.5-Math-PRM 模型能力

Qwen 发布了两个在 Qwen2.5-Math-7B-Instruct 和 Qwen2.5-Math-72B-Instruct 上微调的 PRM 版本。这些模型旨在通过对单个推理步骤进行评分来提供过程监督。

Best-of-N (BoN) 性能

在 Best-of-N 评估中,PRM 从 $N$ 个候选响应中选择得分最高的一个。对于 Qwen2.5-Math-PRM-7B,$N=8$ 个响应是在七个基准(GSM8K、MATH、Minerva Math、GaoKao 2023 En、OlympiadBench、College Math 和 MMLU STEM)上的 Qwen2.5-Math-7B-Instruct 中采样得到的。

  • 性能提升:Qwen2.5-Math-PRM-7B 在所有七个任务上均优于多数投票基线(maj@8),平均提升 1.4%。
  • 比较:Qwen2.5-Math-PRM-72B 的整体表现优于 Qwen2.5-Math-RM-72B,最显著的提升出现在 MMLU STEM 和 Minerva Math 任务中。

在 ProcessBench 上的错误识别

在 ProcessBench 上进行测试时,PRM 展现出识别错误推理步骤的高能力:

  • 竞争地位:Qwen2.5-Math-PRM-7B 超过了所有其他开源模型和专有模型(如 GPT-4o-0806)。
  • 相对性能:虽然 Qwen2.5-Math-PRM-7B 优于其他开源 PRM,但与 o1-mini 相比仍存在性能差距。
  • ORM 见解:结果奖励模型(ORM)Qwen2.5-Math-RM-72B 在识别步骤错误方面也表现出显著能力,超过了某些开源 PRM。

对过程监督的影响

Qwen 认识到仅依赖响应级 Best-of-N 评估可能导致潜在偏差。通过引入 ProcessBench,实验室旨在填补逐步评估的空白,并突出当前用于 PRM 的数据构建方法的局限性。这些模型和基准的发布旨在促进未来关于可扩展监督和 LLM 推理过程可信度的研究。

Sources