Qwen2.5-Math-PRM 與 ProcessBench 發布

Qwen 發布了兩個新的 Process Reward Model (PRM),Qwen2.5-Math-PRM-7BQwen2.5-Math-PRM-72B,以及一個名為 ProcessBench 的新評估基準。這些發布旨在透過識別和緩解中間推理步驟的錯誤,而非僅依賴最終答案,來提高大型語言模型 (LLM) 在數學推理上的可靠性。

ProcessBench: 步驟級評估基準

ProcessBench 旨在衡量模型識別數學推理中錯誤步驟確切位置的能力。與傳統的響應級評估不同,ProcessBench 專注於解決方案的逐步驗證。

  • 資料組成:基準包含 3,400 個測試案例,主要聚焦於競賽和奧林匹克級數學。
  • 標註:每個測試案例包含一個逐步解答,其中人類專家已標註錯誤的位置。
  • 任務:模型會根據其識別包含錯誤的最早步驟的能力,或正確得出整個解答正確的結論來進行評估。
  • 適用性:該基準可用於評估 PRM 和一般的「批評」模型(其中一般的 LLM 會被提示逐步批評解決方案)。

Qwen2.5-Math-PRM 模型能力

Qwen 已發布兩個在 Qwen2.5-Math-7B-Instruct 和 Qwen2.5-Math-72B-Instruct 上微調的 PRM 版本。這些模型旨在透過對個別推理步驟進行評分來提供過程監督。

Best-of-N (BoN) 性能

在 Best-of-N 評估中,PRM 會從 $N$ 個候選回答中選擇得分最高的。對於 Qwen2.5-Math-PRM-7B,$N=8$ 個回答是從 Qwen2.5-Math-7B-Instruct 在七個基準 (GSM8K, MATH, Minerva Math, GaoKao 2023 En, OlympiadBench, College Math, 和 MMLU STEM) 中抽樣的。

  • 效能提升:Qwen2.5-Math-PRM-7B 在所有七項任務上均超過多數投票基準 (maj@8),平均提升 1.4%。
  • 比較:Qwen2.5-Math-PRM-72B 的整體表現優於 Qwen2.5-Math-RM-72B,顯著提升主要出現在 MMLU STEM 和 Minerva Math 任務。

在 ProcessBench 上的錯誤識別

在 ProcessBench 上進行測試時,PRM 展現出識別錯誤推理步驟的高能力:

  • 競爭地位:Qwen2.5-Math-PRM-7B 優於所有其他開源模型和如 GPT-4o-0806 等專有模型。
  • 相對性能:儘管 Qwen2.5-Math-PRM-7B 優於其他開源 PRM,但與 o1-mini 相比仍存在性能差距。
  • ORM 洞察:結果獎勵模型 (ORM) Qwen2.5-Math-RM-72B 也展現出識別步驟錯誤的顯著能力,超過一些開源 PRM。

對過程監督的影響

Qwen 指出,僅依賴響應級 Best-of-N 評估可能會導致潛在偏見。通過引入 ProcessBench,實驗室旨在填補步驟級評估的空白,並凸顯當前用於 PRM 的數據構建方法的局限性。這些模型和基準的發布旨在促進未來關於可擴展監督以及 LLM 推理過程可信度的研究。

Sources