Hugging Face Deep RL コース ユニット2 パート1:Q-ラーニング概念の紹介

TL;DR

Hugging Face は Deep Reinforcement Learning クラスの第一部を公開し、価値ベース手法の理論、ベルマン方程式、Monte‑Carlo と Temporal‑Difference 学習の違いを取り上げました。これらは今後の Q‑Learning チュートリアルに不可欠な基礎です。


強化学習とは? – コアアイデア

Reinforcement Learning (RL) は、環境と相互作用しながら逐次的な意思決定を行う エージェント を訓練し、フィードバックとして 報酬 を受け取り、期待累積報酬の最大化 を目指します。意思決定ルールは policy (π) と呼ばれ、観測された各状態を行動(または行動の確率分布)にマッピングします。最終的な目標は、optimal policy π* を見つけ、可能な限り高い期待リターンを得ることです。

RL 手法には大きく二つの系統があります:

  • Policy‑based methods: ポリシーのパラメータを直接最適化します。
  • Value‑based methods: 価値関数 を学習し、状態(または状態‑行動ペア)の良さを推定し、その関数からポリシーを導出します(多くの場合、greedy または ε‑greedy ポリシー)。

この記事は value‑based 側に焦点を当てています。

価値ベース手法の二つのタイプ

状態価値関数 (V)

ポリシー π の下での状態価値関数は次のように定義されます:

( V^{\pi}(s) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s \big] )

エージェントが 状態 s で開始 し、その後 π に従うときの期待割引リターンを示します。

行動価値関数 (Q)

行動価値関数は V を状態‑行動ペアに拡張したものです:

( Q^{\pi}(s, a) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s, A_t = a \big] )

エージェントが 状態 s で開始 し、行動 a を取り、その後 π に従うときの期待リターンを測ります。

両関数は最終的に 期待リターン を表しますが、Q は価値ベースアルゴリズムにおける greedy 行動選択 に必要な粒度を提供します。

ベルマン方程式 – 再帰的価値推定

すべての可能な将来の軌跡を列挙して V や Q を計算することは現実的ではありません。ベルマン方程式 は再帰的な代替手段を提供します:

( V^{\pi}(s) = R_{t+1} + \gamma ; V^{\pi}(s') )

ここで (s') は π が指示する行動を取った後の次の状態です。Q 値の場合、再帰は次のようになります:

( Q^{\pi}(s, a) = R_{t+1} + \gamma ; \mathbb{E}{s'}\big[ \max{a'} Q^{\pi}(s', a') \big] )

記事の簡略化された例では、割引率 (\gamma) は 1 に設定されているため、ベルマン更新は 即時報酬 + 次状態の価値 に簡略化されます。この再帰は Monte‑Carlo と Temporal‑Difference 学習の両方の基礎となります。

Monte‑Carlo と Temporal‑Difference (TD) 学習の比較

両手法は経験を用いて価値推定を更新しますが、更新のタイミング方法 が異なります。

Monte‑Carlo (MC) 学習

  • When? エピソード全体が終了した後。

  • How? 各訪問状態について return (G_t = \sum_{k=t}^{T} \gamma^{k-t} R_{k+1}) を計算し、ターゲットとして使用します:

    ( V(s) \leftarrow V(s) + \alpha \big[ G_t - V(s) \big] )

  • Pros: 真の割引リターンを使用し、ブートストラップによるバイアスがありません。

  • Cons: 完全なエピソードが必要で、分散が大きく、情報の伝搬が遅いです。

Temporal‑Difference (TD) 学習

  • When? 各ステップごとに。

  • How? 即時報酬と次状態価値の現在の推定を用いて TD target を作ります:

    ( V(s) \leftarrow V(s) + \alpha \big[ R_{t+1} + \gamma V(s') - V(s) \big] )

  • Pros: オンラインで更新され、分散が低く、学習が速いです。

  • Cons: 現在の (V(s')) の推定に依存するためバイアスが生じます(ブートストラップ)。

記事はシンプルなグリッドワールドのマウス例で両アプローチを示し、学習率 (\alpha = 0.1) と (\gamma = 1) に対する更新のステップバイステップ計算を示しています。

重要ポイントのまとめ

  • Value‑based RL は期待リターンを予測する関数 (V または Q) を学習し、ポリシーはこの関数から導出されます(例:greedy または ε‑greedy)。
  • State‑value (V) は状態を評価し、action‑value (Q) は状態‑行動ペアを評価して直接的な行動選択を可能にします。
  • ベルマン方程式 は、全列挙を単純な更新(即時報酬 + 割引次状態価値)に置き換える再帰的な定式化を提供します。
  • Monte‑Carlo は完全エピソード後に真のリターンを用いて更新し、TD 学習 は各ステップ後にブートストラップ推定を用いて更新します。
  • これらの概念を習得することは、Atari ゲームで人間レベルの性能を達成した最初の深層強化学習アルゴリズムである Q‑Learning に取り組む前提条件です。

コースの次のステップ

記事では、第二部で Q‑Learning を取り上げ、2 つの環境でハンズオン実装を行うことが発表されています:

  1. FrozenLake‑v1 (non‑slippery) – スタート (S) からゴール (G) へ、穴 (H) を避けて移動します。
  2. Taxi‑v3 – グリッド都市で乗客を目的地間で輸送することを学びます。

受講者は投稿内のクイズで理解度をテストし、Google Form を通じてフィードバックを提供することが奨励されています。

学び続けて、最高であり続けよう!

Sources