OpenAI 通过过程监督改进数学推理
OpenAI 通过实施过程监督在数学问题求解上达到了新的最先进水平,过程监督是一种方法,它会奖励模型每一步正确的推理,而不仅仅是奖励正确的最终答案。这种方法不仅提升了数学性能,还通过训练模型产生人类认可的思维链来改进 AI 对齐。
过程监督 与 结果监督
过程监督为思维链中的每一步提供反馈,而结果监督仅基于最终结果提供反馈。这一区别对于减轻“幻觉”——即使在最先进的大型语言模型中也会发生的逻辑错误——至关重要。
通过奖励过程,模型会被直接训练以遵循人类认可的逻辑路径。相比之下,结果监督可能会无意中奖励一个不一致或错误的推理过程,尽管该过程恰好得到了正确的最终答案,这使得审查变得更困难且可靠性降低。
对 AI 对齐和“对齐税”的影响
过程监督为 AI 对齐提供了几个明显的优势:
- 可解释的推理: 因为模型被鼓励遵循人类批准的过程,产生的推理链更具可解释性。
- 直接对齐: 推理过程的每一步都会获得精确的监督,确保模型遵循一致的思维链。
- 负的对齐税: 通常,实施更安全的 AI 方法会导致性能下降,这种现象被称为“对齐税”。然而,在数学领域,过程监督会产生“负的对齐税”,这意味着它实际上在提升模型能力的同时也改善了对齐。
MATH 数据集上的性能基准
OpenAI 使用 MATH 测试集评估了过程监督和结果监督的奖励模型。评估过程涉及为每个问题生成多个解决方案,并选择各奖励模型排名最高的解决方案。
关键发现包括:
- 更高的准确性: 过程监督奖励模型在所有测试场景中均优于结果监督模型。
- 可靠性提升: 随着每个问题考虑的解决方案数量增加,两种方法之间的性能差距扩大,表明过程监督奖励模型在识别正确推理路径方面更可靠。
案例研究:复杂三角函数
为了展示奖励模型的有效性,OpenAI 强调了一个涉及化简 $ an 100^{\circ} + 4 \sin 100^{\circ}$ 的具有挑战性的三角函数问题。
尽管 GPT-4 通常在这特定问题上表现困难——只有 0.1% 的解答尝试能够得到正确答案——但过程监督奖励模型能够正确识别一个有效解。该有效解需要一个复杂的 26 步三角恒等式和简化序列才能得到正确答案 $-\sqrt{3}$。
未来研究方向
虽然这些结果对数学推理具有重要意义,但 OpenAI 指出目前尚不清楚过程监督在其他领域的泛化范围有多广。未来研究将重点探讨此方法是否能够在非数学任务中提供类似的性能提升和对齐改进的组合。