策略梯度、PPO 裁剪以及用于 LLMs 的思维链 RL – 斯坦福 CS229 第 20 讲
策略梯度推导与基线
策略梯度定理指出,预期回报的梯度等于随时间求和的动作对数概率梯度乘以回报的期望。由于在没有奖励时对数概率梯度的期望为零,任何不依赖于动作的项都可以被加减而不改变期望。这一性质允许引入仅依赖于状态的基线;减去这样的基线不会改变预期梯度,但在实践中可以降低方差。
重要性采样与在策略限制
天真的策略梯度估计器需要从当前策略采样轨迹,使其成为在策略的:参数更新后,旧样本无法重复使用。重要性采样通过使用旧策略 π_old 的样本并按照比率 π_θ(a|s) / π_old(a|s) 重新加权来纠正这一点。在实际中,只有比率的动作部分是可计算的,因此得到的估计器在状态上使用旧策略,但通过比率校正动作分布。
近端策略优化(PPO)裁剪规则
PPO 通过裁剪概率比率来修改代理目标,以防止过大的更新。对于给定的优势 Â_t:
- 如果 Â_t > 0 且比率 r_t = π_θ(a_t|s_t) / π_old(a_t|s_t) 高于 1 + ε_high,则贡献被裁剪为 (1 + ε_high) Â_t,导致梯度为零。
- 如果 Â_t > 0 且 r_t 低于裁剪阈值,则该项为 r_t Â_t 并采取梯度。
- 如果 Â_t < 0 且 r_t 低于 1 − ε_low,则贡献被裁剪为 (1 − ε_low) Â_t,同样导致梯度为零。
- 如果 Â_t < 0 且 r_t 高于下阈值,则该项为 r_t Â_t 并采取梯度。 讲座中提到的典型值为 ε_high ≈ 0.28 且 ε_low ≈ 0.2。裁剪实现了这样的思想:当新策略已经足够好或足够坏时,不需要进一步更新。
PPO 的变体(GRPO 和 SIPO)
讲座描述了基本 PPO 方案的两种扩展。
- GRPO(被称为 PO 的“高级版本的 PO”)采用相同的裁剪逻辑,但当比率超过上阈值时,它将贡献设为零,而不是保持一个常量裁剪值。
- SIPO(在转录中称为 “SIS pole”)通过在比率较大时保持非零常数梯度来区分:它将比率裁剪为 1 而不是将项置零,从而在仍然限制幅度的同时保留一些学习信号。 两种变体旨在权衡稳定性和学习速度,SIPO 在高比率 regime 中保留更多的梯度信号。
将 RL 应用于 LLMs 以进行思维链
为了训练语言模型产生思维链推理,将生成过程视为一个马尔可夫决策过程,其中状态是提示和先前生成的标记的连接,动作是下一个标记,转换是确定的(追加所选标记)。奖励仅在轨迹结束时给出,基于最终答案是否匹配真实解;中间思考标记不直接获得奖励。此设置允许使用任何策略梯度方法,包括 PPO 或其变体,以优化模型以得到正确答案同时鼓励多步推理。
在 LLM 训练中的奖励设计与基线
由于奖励是二元的(正确答案为 1,否则为 0),方差可能较高。一种常见的基线是对同一提示的多个采样轨迹的平均奖励:计算八次 rollout 的奖励 R₁…R₈,取它们的均值 R̄,并从每个单独的奖励中减去 R̄ 以获得优势估计。此基线仅依赖于提示(状态),因此满足减去它不会改变预期梯度的条件。可以应用额外的归一化(例如,除以标准差),但已注明这是可选的,供进一步研究。