训练时扩展与用于自我改进 AI 智能体的强化学习扩展

训练时扩展概述

训练时扩展的核心思想是使用模型自身的输出,通过正确性进行过滤,并在这些过滤后的输出上对模型进行微调,从而用计算量替代模型参数。这创造了一个循环,其中生成的解决方案被验证,如果正确则保留,并用于进一步改进模型。这种循环在具有强验证器的领域(如数学推理或代码执行)效果最好,因为最终答案可以自动检查。

STaR: Bootstrapping Rationales

STaR (Self‑Taught Reasoner) 通过从一小部分“问题‑合理逻辑-答案”示例开始,生成更大规模的问题集的答案,仅保留正确答案的部分,并对错误的尝试提供正确答案作为提示并要求模型生成合理逻辑,从而引导推理链。模型随后在收集到的合理逻辑和答案上进行微调,且该过程可以迭代重复。正如转录文本所述,“STaR 的关键见解非常简单”——它将最终答案的正确性作为推理质量的代理指标,并假设模型在给定答案作为提示时能够生成有效的合理逻辑。在 GPT‑J (6 B) 上的实验表明,它在 CommonsenseQA 上表现有所提升(在使用仅 86% 的数据量进行标准监督微调的情况下达到了 72.5% 的准确率),但在 GSM8K 上几乎没有收益,因为在 GSM8K 上直接使用高质量数据进行微调表现相似。STaR 在几次迭代后会进入平台期,因为它不是一种完整的强化学习方法。

DeepSeekMath and GRPO

DeepSeekMath 通过从代码预训练模型开始,从 Common Crawl (OpenWebMath) 中整理数学数据,并应用 Group Relative Policy Optimization (GRPO) 来扩展数学推理的强化学习。GRPO 用基于组的优势估计取代了 PPO 中使用的 critic 和 value function:对于每个问题,采样多个答案,由奖励模型评分,并将优势计算为 (reward − mean reward) / stddev reward。这只需要三个模型副本,而不是 PPO 所需的四个,因此具有内存效率。在一个较简单的数学基准测试(非 AIME)上,使用 7 B 模型,DeepSeekMath 将准确率从 46.8% 提高到了 51.7%。这种提升体现在 majority‑at‑K 指标上,而 pass‑at‑K 没有增加,这表明了更高的稳定性,而不是基本问题解决能力的飞跃跃升。

DAPO: Stabilizing RL for Long Reasoning

DAPO 解决了将 GRPO 应用于长思维链推理时出现的三个不稳定性问题:熵崩溃、不受控的响应长度以及噪声截断输出。它引入了非对称裁剪(允许比减少量更大的增加量,类似于 PPO 的 clip),动态采样(过滤掉全 0 或全 1 奖励的组以保持有用的梯度信号)、token‑level loss(通过 token 数量而不是平等对待每个序列来对 loss 进行加权)、以及对过长 token 的逐渐惩罚以抑制不受控的生成。应用于 AIME 基准测试并使用 Qwen‑32B 模型时,基准 GRPO 的准确率约为 30%;添加过长过滤后提升至 n/a,添加非对称裁剪后提升至 38%,添加软性过长惩罚后提升至 41%,添加 token‑level loss 后提升至 42%,以及添加动态采样后提升至 ~50%。与之前的方法相比,增益在于 majority‑at‑K 性能,而非 pass‑at‑K。

Results on AIME and Reasoning Benchmarks

讲座对比了传统的“随参数扩展”观点与训练时扩展的结果:一个 175 B 参数的模型 (GPT‑3.5) 在 AIME 上的得分仅约为 5%,而使用 DeepSeekMath 训练的 7 B 模型达到了 51.7%(使用额外技巧可达 60%),以及使用 DAPO 训练的 32B 模型达到了 ~50%。这些结果表明,投入计算量用于生成和过滤推理轨迹,可以替代模型规模,但主要效果是提高多个样本间的稳定性(更高的 majority‑at‑K),而不是解决此前无法解决的问题的能力 (pass‑at‑K)。

Open Questions and Limitations

演讲结束时提出了几个开放的研究方向:为什么 majority‑at‑K 会提高而 pass‑at‑K 不提高;如何从失败的尝试中学习,而不是仅仅过滤掉它们;在数据稀缺时如何获得足够的验证信号(例如,使用验证器集成);以及将 STaR 风格的合理逻辑生成与 DAPO 风格的强化学习稳定化结合起来是否可以产生进一步的收益。它还指出,训练时扩展仍然依赖于强大的奖励信号和验证器,且该方法目前还不能教导模型在提高已知格式的稳定性方面之外,泛化到全新的问题类型。

Sources