自我改进型 AI Agent 验证方法概述
训练验证器以解决数学应用题 (OpenAI 2021)
核心结论是,训练用于预测完整解题过程正确性的验证器,在结合重复采样时可以提高答案选择的准确率,尤其是随着验证器训练集的增长。 该论文引入了 GSM8K 数据集,包含 8,500 个需要多步推理和自然语言解答的小学数学问题。 为了训练验证器,作者在 GSM8K 的一部分数据上对语言模型进行了两个 epoch 的微调,然后为每个问题生成 100 个补全结果,使用人工提供的最终答案将每个补全结果标记为正确或错误,并在这些标记数据上训练验证器一个 epoch。 验证器架构是一个带有标量头(scalar head)的语言模型,它为每个 token 输出一个二元预测;在测试时,使用最后一个 token 的分数来对补全结果进行排名并选择得分最高的那个。 消融实验表明,当验证器看到超过约 1,000 个标记样本时,验证过程优于纯监督微调,并且较大的生成器与较小的验证器搭配使用往往比反过来效果更好。 增加每个问题的补全数量可以提高准确率,直到大约 400 个样本;超过这个数值后,验证器的精度会下降,因为它无法区分非常接近的正确答案和错误答案。
逐步验证 (OpenAI)
主要结论是,过程监督奖励模型 (PRM) 比结果监督奖励模型 (ORM) 提供更细粒度的信用分配,并且对幻觉更具鲁棒性,尤其是在可以使用人工标注的逐步正确性时。 作者创建了 PRM800K 数据集,其中包含 800,000 个针对模型生成的推理链的人工标注步骤标签。 对于 ORM 训练,他们使用最后一个 token 的分数作为奖励;对于 PRM 训练,他们将每一步的概率相乘以获得序列级奖励。 在 GSM8K 上的实验表明,PRM 优于 ORM 和多数投票法,能够正确识别 ORM 会错过的罕见正确解,并且 PRM 比 ORM 能从额外的标签中获益更多。 过程监督减少了假阳性,因为模型无法通过错误的推理路径得出正确的最终答案来获得高奖励;逐步标签会惩罚这种“走捷径”的行为。 作者指出,结合 PRM 和 ORM 信号可以同时获得两者的优点,但会引入一个必须进行调优的阈值超参数。
Math-Shepherd: 自动步骤级标注
关键结果是,步骤级标签可以通过估计每一步通过采样达到正确最终答案的潜力来自动生成,无需人工标注,并且这种自动化的 PRM 可以用作强化学习的奖励模型,以进一步改进生成器。 给定一个当前的推理步骤,该方法会采样 N 个后续补全;“硬估计”(hard estimate)如果任何一个后续补全达到了正确的最终答案,则将该步骤标记为成功,而“软估计”(soft estimate)则使用成功补全的比例。 作者发现,当 N = 4 时,硬估计和软估计的表现相似,因此他们为了简单起见选择了硬估计。 使用这些自动生成的标签,他们训练了一个 PRM,然后应用 PPO 来针对 PRM 微调生成器(例如 Mistral-7B),与使用基于 ORM 的奖励相比,在 GSM8K 上实现了更高的准确率,并在更具挑战性的 MATH 数据集上获得了更大的提升。 该方法对于 self-consistency(多数投票)基准测试也有效,表明学习到的 PRM 提供了比简单的基于投票的选择更强的信号。
Weaver: 弱验证器集成
核心发现是,通过弱到强监督(例如 Naive Bayes 或 logistic regression)将许多不完美的验证器结合起来,可以产生一个显著更强的验证器,并且生成的集成模型可以被蒸馏到一个小模型中,该模型在保留大部分准确率的同时,使用远少的测试时计算量。 Weaver 将每个验证器(PRM, ORM, LLM judge, 等)视为为候选解提供一个带噪声的标签;在假设验证器错误是相互独立的假设下,它从一个小规模的标记数据集上估计验证器的准确率,并计算出组合其分数的最佳权重。 在加权之前,会过滤掉低质量的的验证器。 在 GPQA Diamond, MATH, 和 MLU Pro 等困难基准测试上,对于一个 8B 参数的生成器,加权集成法将准确率从略高于 判 40% 提高到 70% 以上,达到了像 o3-mini 这样的大规模模型性能。 将加权集成模型蒸馏到 400-million 参数的模型中,可以在减少 99% 或更多测试时计算量的情况下,保留集成模型 97% 的准确率。 所有检查点(checkpoints)均已开源,可用于 agentic 或 test-time scaling 项目。