정책 그래디언트, PPO 클리핑, 그리고 LLM을 위한 사고사슬 RL – Stanford CS229 강의 20
정책 그래디언트 유도와 베이스라인
정책 그래디언트 정리는 기대 수익의 그래디언트가 시간에 따른 로그 확률의 그래디언트와 수익을 곱한 합의 기대와 같다고 말한다. 로그‑확률 그래디언트는 보상이 없을 때 기대값이 0이 되므로, 행동에 의존하지 않는 어떤 항도 기대값을 바꾸지 않고 더하거나 뺄 수 있다. 이 속성은 상태에만 의존하는 베이스라인을 도입할 수 있게 해주며,这样的 베이스라인을 빼도 기대 그래디언트는 변하지 않지만 실제로는 분산을 줄일 수 있다.
중요도 샘플링과 온‑폴리시 제한
순진한 정책 그래디언트 추정기는 현재 정책에서 trajectories를 샘플링해야 하며,これにより 온‑폴리시가 된다: 매개변수 업데이트 후에는 이전 샘플을 재사용할 수 없다. 중요도 샘플링은 이전 정책 π_old의 샘플을 비율 π_θ(a|s) / π_old(a|s)로 재가중치하여 이를 보정한다. 실무에서는 비율의 행동 부분만 계산 가능하며, 이로 인해 상태에 대해서는 이전 정책을 사용하고 행동 분포는 비율로 보정하는 추정기가 된다.
근접 정책 최적화(PPO) 클리핑 규칙
PPO는 확률 비율을 클리핑하여 과도하게 큰 업데이트를 방지함으로써 서로게이트 목표를 수정한다. 주어진 이점 Â_t에 대해:
- Â_t > 0이고 비율 r_t = π_θ(a_t|s_t) / π_old(a_t|s_t)가 1 + ε_high보다 클 경우, 기여도는 (1 + ε_high) Â_t로 클리핑되어 그래디언트가 0이 된다.
- Â_t > 0이고 r_t가 클리핑 임계값보다 작을 경우, 항은 r_t Â_t이며 그래디언트를 취한다.
- Â_t < 0이고 r_t가 1 − ε_low보다 작을 경우, 기여도는 (1 − ε_low) Â_t로 클리핑되어 다시 그래디언트가 0이 된다.
- Â_t < 0이고 r_t가 하한 임계값보다 클 경우, 항은 r_t Â_t이며 그래디언트를 취한다. 강의에서 언급된 일반적인 값은 ε_high ≈ 0.28 및 ε_low ≈ 0.2이다. 클리핑은 새로운 정책이 이전 정책보다 충분히 더 좋거나 나쁠 때 추가 업데이트가 필요하지 않다는 아이디어를 구현한다.
PPO의 변형(GRPO 및 SIPO)
강의에서는 기본 PPO 방식의 두 가지 확장을 설명한다.
- GRPO(‘PO의 고급 버전’이라고 불림)는 동일한 클리핑 로직을 적용하지만, 비율이 상한 임계값을 초과할 때 기여도를 상수 클리핑 값이 아닌 0으로 설정한다.
- SIPO(전사에서 ‘SIS pole’이라고 불림)는 비율이 클 때 0이 아닌 상수 그래디언트를 유지함으로써 다르다: 항을 0으로 만드는 대신 비율을 1로 클리핑하여 크기를 제한하면서도 일부 학습 신호를 보존한다. 두 변형 모두 안정성과 학습 속도 사이의 trade-off를 목표로 하며, SIPO는 높은 비율 구간에서 더 많은 그래디언트 신호를 유지한다.
사고사슬(Chain‑of‑Thought)을 위한 LLM에 RL 적용
언어 모델이 사고사슬 추론을 생성하도록 훈련하기 위해, 생성 과정은 프롬프트와 이전에 생성된 토큰의 연결을 상태, 다음 토큰을 행동, 선택된 토큰을 추가하는 결정적 전이(앱ending)로 보는 마르코프 결정 과정으로 간주된다. 보상은 trajectory의 끝에만 주어지며, 최종 답이 정답과 일치하는지에 기반한다; 중간 사고 토큰은 직접 보상받지 않는다. 이 설정은 PPO나 그 변형을 포함한 어떤 정책 그래디언트 방법이라도 사용하여 정답에 대한 모델을 최적화하면서 다단계 추론을 장려할 수 있게 한다.
LLM 훈련에서의 보상 설계 및 베이스라인
보상이 이진값(정답이면 1, 아니면 0)이기 때문에 분산이 클 수 있다. 일반적인 베이스라인은 동일한 프롬프트에 대해 여러 샘플링된 trajectory의 평균 보상이다: 여덟 번의 rollout에 대한 보상 R₁…R₈을 계산하고, 그 평균 R̄을 구한 후 각 개별 보상에서 R̄을 빼서 이점 추정치를 얻는다. 이 베이스라인은 프롬프트(상태)에만 의존하므로, 이를 빼도 기대 그래디언트가 변하지 않는다는 조건을 만족한다. 추가 정규화(예: 표준편차로 나누기)는 적용될 수 있으나 추가 연구를 위한 선택 사항으로 언급되었다.