스탠퍼드 CS229 강의 18 (2026년 봄): 강화 학습과 정책 그래디언트 소개

요약

강화 학습(RL)은 순차적 의사 결정 문제를 마르코프 결정 과정(MDP)으로 framing하고, 감독 라벨 대신 스칼라 보상으로부터 정책을 학습합니다; 이번 강의의 핵심 기여는 정책 그래디언트(REINFORCE) 알고리즘의 유도로, 이를 통해 확률적 정책을 기대 수익에 대한 경사 상승을 통해 직접 최적화할 수 있습니다.

1. 왜 강화 학습인가?

  • 순차적 결정: 행동이 미래 상태에 영향을 미치므로 근시안적인 탐욕적 선택은 비최적일 수 있습니다. 로봇 내비게이션 예시(1‑D 선에서 왼쪽/오른쪽 이동)는 각 단계가 다음 단계에 영향을 미친다는 것을 보여줍니다.
  • 탐색 대 이용: RL은 정보 수집(탐색)과 현재 지식을 활용하여 보상을 최대화하는 것(이용) 사이의 균형을 맞춰야 합니다. 실제로는 많은 응용이 명시적 탐색 전략보다는 알고리즘의 내재적 확률성에 의존합니다.
  • 희박한 감독: 분류와 달리 RL은 궤적이 얼마나 좋은지를 나타내는 스칼라 보상만 제공하며, 최적의 행동은 라벨이 붙어 있지 않습니다.
  • 데이터 수집 루프: 에이전트는 행동을 생성하고, 결과 상태와 보상을 관찰한 후, 좋은 행동을 강화하고 나쁜 행동을 벌하도록 정책을 업데이트합니다.

2. 마르코프 결정 과정(MDP) 형식화

구성 요소 기호 의미
상태 공간 (\mathcal{S}) 환경의 가능한 모든 구성(예: 로봇 관절 각도, 보드 위치).
행동 공간 (\mathcal{A}) 허용 가능한 행동의 집합(예: 관절 토크, 바둑 수).
전이 동역학 (P(s'\mid s,a)) 상태 (s)에서 행동 (a)를 취한 후 상태 (s')에 도달할 확률. 결정적일 수도 있고 확률적일 수도 있습니다.
보상 함수 (r(s)) (또는 (r(s,a)), (r(s,a,s'))) 상태(또는 상태‑행동 쌍)의 바람직함을 나타내는 스칼라 피드백.
할인 인자 (\gamma\in[0,1)) 즉각적인 보상에 더 큰 가중치를 주고 먼 미래의 보상에 덜 가중치를 주어 무한 horizon에서도 유한한 수익을 보장합니다.
  • 궤적(에피소드): 정책에서 행동을 반복적으로 샘플링하고 (P)를 통해 전이하여 생성되는 행동의 시퀀스 ((s_0,a_0,s_1,a_1,\dots)).
  • 수익: (G = \sum_{t=0}^{T}\gamma^{t} r(s_t)). 정책 (\pi) 하에서의 기대 수익은 (J(\pi) = \mathbb{E}_{\pi}[G])로 표기됩니다.
  • 정책: 매핑 (\pi: \mathcal{S}\rightarrow \Delta(\mathcal{A})) (결정적 또는 확률적). 최적의 결정적 정책은 항상 존재하지만, 확률적 정책은 탐색과 그래디언트 기반 학습에 유용합니다.

3. 가치 함수와 최적성

  • 정책의 상태 가치: (V^{\pi}(s) = \mathbb{E}_{\pi}[G\mid s_0=s]).
  • 최적 가치: (V^{*}(s) = \max_{\pi} V^{\pi}(s)).
  • 최적 정책: (\pi^{*} = \arg\max_{\pi} V^{\pi}(s)) (모든 (s)에 대해).
  • 벨만 방정식: 재귀적 관계를 제공하며, 예를 들어 [ V^{\pi}(s) = r(s) + \gamma \sum_{a}\pi(a\mid s) \sum_{s'} P(s'\mid s,a) V^{\pi}(s').\n ] 이러한 선형 방정식을 풀면 작은 이산 MDP에 대한 정확한 값을 얻을 수 있지만, 큰 규모 또는 연속 공간에서는 근사 방법을 사용합니다.

4. 보상 shaping

  • 정의: 최적 정책을 유지하면서 더 부드러운 그래디언트를 제공하기 위해 보상 함수를 수정하는 것.
  • 예시: 바이너리 보상(목표에서 (+1), 그 외에서는 (-0.1)) 대신 목표에 가까운 상태에 더 높은 보상을 부여합니다. 이는 학습 속도를 높일 수 있지만, shaping이 실제 작업 역학을 반영하지 않으면(예: 숨은 순간이동 바로가기) 에이전트를 오도할 수 있습니다.
  • 주의: 과도한 shaping은 학습된 정책을 실제 목표로부터 편향시킬 수 있으므로, 설계자는 정보 제공성과 충실성 사이의 균형을 맞춰야 합니다.

5. 정책 그래디언트(REINFORCE) 유도

  1. 확률적 정책 매개변수화: (\pi_{\theta}(a\mid s))는 각 행동에 대한 확률 밀도(또는 범주형 분포)를 출력하는 신경망으로 표현됩니다.
  2. 목표: 기대 수익 (J(\theta) = \mathbb{E}{\pi{\theta}}[G])를 최대화합니다.
  3. 그래디언트 트릭: [ \nabla_{\theta} J(\theta) = \mathbb{E}{\pi{\theta}}\big[ G ; \nabla_{\theta} \log \pi_{\theta}(a\mid s) \big].\n ]
    • 유도는 기대를 적분으로 표현하여 기대 내부로 그래디언트를 이동시킨 후, 항등식 (\nabla_{\theta} p_{\theta}(x) = p_{\theta}(x) \nabla_{\theta} \log p_{\theta}(x))를 적용합니다.
  4. 실용 추정기: 궤적 배치를 샘플링하고 각 궤적에 대한 수익 (G)를 계산한 후, 위 추정기를 사용하여 확률적 경사 상승으로 (\theta)를 업데이트합니다.
  5. 분산 감소: 기본 REINFORCE 추정기는 높은 분산을 가질 수 있다고 강의에서 언급합니다; 일반적인 기법(베이스라인 감소, 장점 추정)은 언급되지만 상세히 다루지 않습니다.
  6. 전이 모델 불필요: 그래디언트 표현은 (P(s'\mid s,a))에 대한 지식을 요구하지 않으며, 샘플링된 행동과 보상만 필요합니다.

6. 실무자를 위한 핵심 내용

  • MDP 모델링: 상태, 행동, 전이 동역학(시뮬레이션을 통해 암시적으로라도)과 진정한 목표를 포착하는 보상을 식별합니다.
  • 확률적 정책 선택: 그래디언트 기반 최적화와 자연스러운 탐색을 가능하게 합니다.
  • 정책 그래디언트 사용: REINFORCE는 모델 없이 간단히 정책을 개선할 수 있는 방법을 제공하며, 대형 언어 모델 미세 조정에 사용되는 더 고급 알고리즘의 기초가 됩니다.
  • 보상 shaping은 선택 사항이지만 강력함: 학습을 돕기 위해 더 부드러운 보상을 설계하되, shaping이 최적 해를 바꾸지 않았는지 확인합니다.
  • 할인 인자의 중요성: (\gamma)는 단기 보상과 장기 보상의 균형을 맞추고 무한 horizon 문제에서도 유한한 수익을 보장합니다.

7. 참고문헌 및 추가 읽을거리

  • Sutton, R. S., & Barto, A. G. (2018). 강화 학습: 소개 (2판). MIT Press.
  • Williams, R. J. (1992). “연결주의 강화 학습을 위한 간단한 통계적 그래디언트 추종 알고리즘.” Machine Learning, 8(3‑4), 229‑256. (원본 REINFORCE 논문.)
  • CS229 2026年春 강의 노트(코스 웹사이트에서 이용 가능)는 벨만 방정식의 상세한 증명 및 추가 정책 그래디언트 변형을 제공합니다.

Sources