Hugging Face 딥 강화 학습 소개

TL;DR

Hugging Face는 초급부터 전문가까지를 아우르는 무료 딥 강화 학습 (Deep RL) 과정을 시작했으며, RL의 기본 개념, 수학적 프레임워크, 탐험‑활용 트레이드오프, 정책 기반 및 가치 기반 해결 방법, 그리고 딥 신경망의 역할을 가르칩니다.


강화 학습이란

강화 학습 (RL)은 에이전트가 환경과의 시행착오 상호작용을 통해 행동을 배우고 스칼라 보상을 피드백으로 받는 계산 패러다임입니다. 에이전트의 목표는 기대 누적 보상( return )을 최대화하는 것입니다.

큰 그림

RL 에이전트는 상태를 반복적으로 관찰하고, 행동을 선택하며, 보상을 받고, 새로운 상태로 전이합니다. 이 루프는 인간과 동물이 경험을 통해 학습하는 방식을 반영합니다.

형식적 정의

강화 학습은 에이전트를 구축하여 환경으로부터 시행착오 상호작용을 통해 학습하고, 긍정적 또는 부정적 보상을 고유한 피드백으로 받아 제어 과제(결정 문제)를 해결하는 프레임워크입니다.


강화 학습 프레임워크

RL 프레임워크는 상태, 행동, 보상 및 전이 역학을 정의하는 마코프 결정 프로세스(MDP)로 구성됩니다. 에이전트의 목표는 할인된 반환을 최대화하는 정책을 학습하는 것입니다.

RL 프로세스

  1. **State (S₀)**는 환경으로부터 관찰됩니다.
  2. 에이전트는 정책에 따라 **action (A₀)**를 선택합니다.
  3. 환경은 **next state (S₁)**로 전이하고 **reward (R₁)**을 발생시킵니다.
  4. 이 루프가 반복되어 궤적 (S₀, A₀, R₁, S₁, A₁, …)을 생성합니다.

보상 가설

모든 목표는 기대 누적 보상을 최대화하는 것으로 표현될 수 있습니다; 따라서 최적 행동은 가장 높은 반환을 얻는 행동입니다.

마코프 속성

MDP에서 현재 상태가 주어지면 미래는 과거와 독립입니다; 에이전트는 다음 행동을 선택하기 위해 현재 상태만 필요합니다.

상태 vs 관측

  • State: 환경에 대한 완전한 설명(예: 전체 체스 보드).
  • Observation: 상태의 부분적인 보기(예: 마리오 레벨의 보이는 부분).

행동 공간

  • Discrete: 유한한 행동 집합(예: 플랫폼 게임에서 좌/우/점프).
  • Continuous: 무한한 행동 집합(예: 자율 주행 차량의 조향 각도).

보상 및 할인

할인된 반환은 (G_t = \sum_{k=0}^{\infty} \gamma^k R_{t+k+1})이며, 여기서 (\gamma \in [0,1])은 즉시 보상과 미래 보상 사이의 트레이드오프를 제어합니다. (\gamma) 값이 클수록 에이전트는 장기 결과에 더 많은 관심을 갖게 됩니다.

작업 유형

  • Episodic tasks는 시작과 종료 상태를 가집니다(예: 마리오 레벨).
  • Continuing tasks는 종료 상태 없이 무한히 실행됩니다(예: 알고리즘 기반 주식 거래).

탐험 vs. 활용

탐험(알려지지 않은 행동을 시도)과 활용(이미 알려진 고보상 행동을 사용하는 것)의 균형을 맞추는 것은 최적 정책을 발견하는 데 필수적입니다. 순수한 활용만 하면 에이전트가 최적이 아닌 지역 최대값에 갇히게 되고, 과도한 탐험은 자원을 낭비합니다.


RL 문제 해결을 위한 주요 접근법

두 가지 알고리즘 계열이 최적 정책 (\pi^*)을 찾는 것을 목표로 합니다:

정책 기반 방법

  • 상태를 행동에 매핑하는 policy function (\pi(a|s)) (결정적) 혹은 행동에 대한 확률 분포(확률적)를 직접 학습합니다.
  • 학습된 정책은 에이전트의 “뇌”가 됩니다.

가치 기반 방법

  • 상태(또는 상태‑행동 쌍)에서 기대 할인 반환을 추정하는 value function (V(s)) 또는 행동‑가치 함수 (Q(s,a))를 학습합니다.
  • 정책은 추정된 가치를 최대화하는 행동을 선택함으로써 간접적으로 도출됩니다.

딥 강화 학습에서 “Deep”의 의미

Deep RL은 정책이나 가치 함수를 근사하기 위해 고전 RL 알고리즘에 딥 신경망을 추가하여 원시 픽셀과 같은 고차원 상태 공간에 대한 확장성을 가능하게 합니다. 예를 들어, Deep Q‑Learning은 Q‑값을 예측하는 신경망으로 표 형태의 Q‑매트릭스를 대체합니다.


강좌 일정 및 자료

  • 이 튜토리얼은 Hugging Face Deep RL ClassUnit 1이며, 이론에서 실습 프로젝트까지 진행되는 무료 오픈소스 커리큘럼입니다.
  • 학생들은 인기 라이브러리 Stable Baselines3, RL Baselines3 Zoo, and RLlib을 사용할 것입니다.
  • 예시 환경으로 SnowballFight, Huggy the Doggo, Space Invaders, PyBullet, and LunarLander가 있습니다.
  • 학습된 에이전트는 단일 명령으로 Hugging Face Hub에 게시할 수 있으며, 커뮤니티 에이전트를 다운로드할 수도 있습니다.
  • 강좌에는 챌린지, 퀴즈, 맞춤 Unity 또는 Godot 환경을 공유하는 방법이 포함됩니다.

다음 단계

다음 유닛에서는 Q‑Learning 및 가치 기반 방법을 다루며, 고전적인 표 형태 접근법과 딥 신경망 근사법을 비교합니다.


“강화 학습은 행동으로부터 학습하는 계산적 접근 방식입니다. 우리는 시행착오를 통해 환경과 상호작용하고 보상(음성 또는 양성)을 피드백으로 받으며 학습하는 에이전트를 구축합니다.” – Hugging Face Deep RL Introduction

Sources