Hugging Face 深度強化學習課程 第2單元 第1部分:Q學習概念導論

TL;DR

Hugging Face 發布了其深度強化學習課程的第一篇,涵蓋了基於價值方法的理論、貝爾曼方程式,以及 Monte‑Carlo 與 Temporal‑Difference 學習的區別,這些都是即將到來的 Q‑Learning 教程的必要基礎。


什麼是強化學習? – 核心概念

強化學習 (RL) 透過讓 agent 與環境互動、接收 rewards 作為回饋,並旨在 maximize expected cumulative reward,來訓練其做出序列決策。這種決策規則稱為 policy (π),它將每個觀測到的狀態映射到一個動作(或動作的機率分布)。最終目標是發現 optimal policy π*,以獲得最高的期望回報。

RL 方法大致可分為兩大類:

  • Policy‑based methods:直接優化 policy 參數。
  • Value‑based methods:學習一個 value function,用以估計狀態(或狀態‑動作對)的好壞,然後從該函數衍生出 policy(通常是 greedy 或 ε‑greedy policy)。

本文聚焦於 value‑based 方面。


兩種基於價值的函數

狀態價值函數 (V)

在 policy π 下的狀態價值函數定義為:

( V^{\pi}(s) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s \big] )

它給出當 agent 從狀態 s 開始,並在此之後遵循 π 時的期望折扣回報。

動作價值函數 (Q)

動作價值函數將 V 擴展到狀態‑動作對:

( Q^{\pi}(s, a) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s, A_t = a \big] )

它衡量當 agent 從狀態 s 開始,執行動作 a,然後遵循 π 時的期望回報。

兩個函數最終都代表 expected returns,但 Q 提供了在基於價值的演算法中進行 greedy action selection 所需的細粒度。


貝爾曼方程式 – 遞迴價值估計

透過列舉所有可能的未來軌跡來計算 V 或 Q 是不可行的。Bellman equation 提供了一種遞迴的替代方案:

( V^{\pi}(s) = R_{t+1} + \gamma ; V^{\pi}(s') )

其中 (s') 是在執行 π 所規定的動作後的下一個狀態。對於 Q 值,遞迴形式為:

( Q^{\pi}(s, a) = R_{t+1} + \gamma ; \mathbb{E}{s'}\big[ \max{a'} Q^{\pi}(s', a') \big] )

在本文的簡化範例中,折扣因子 (\gamma) 設為 1,因此貝爾曼更新簡化為 immediate reward + value of the next state。此遞迴是 Monte‑Carlo 與 Temporal‑Difference 學習的基礎。


Monte‑Carlo 與 Temporal‑Difference (TD) 學習

兩種方法皆利用經驗來更新價值估計,但在 whenhow 更新發生的時機與方式上有所不同。

Monte‑Carlo (MC) 學習

  • When? 整個回合結束後。
  • How? 計算每個被訪問狀態的 return (G_t = \sum_{k=t}^{T} \gamma^{k-t} R_{k+1}),並將其作為目標:

    ( V(s) \leftarrow V(s) + \alpha \big[ G_t - V(s) \big] )

  • Pros:使用真實的折扣回報,沒有來自 bootstrap 的偏差。
  • Cons:需要完整的回合;變異大;資訊傳播較慢。

Temporal‑Difference (TD) 學習

  • When? 每一步之後。
  • How? 使用即時回報與下一狀態當前估計值形成 TD target

    ( V(s) \leftarrow V(s) + \alpha \big[ R_{t+1} + \gamma V(s') - V(s) \big] )

  • Pros:線上更新,變異較低,學習更快。
  • Cons:因依賴當前對 (V(s')) 的估計(bootstrap)而產生偏差。

本文以簡單的格子世界老鼠範例說明兩種方法,展示學習率 (\alpha = 0.1) 與 (\gamma = 1) 下逐步的更新計算。


重點摘要

  • Value‑based RL 學習一個函數(V 或 Q)以預測期望回報;policy 從此函數衍生(例如 greedy 或 ε‑greedy)。
  • State‑value (V) 評估狀態;action‑value (Q) 評估狀態‑動作對,從而直接選擇動作。
  • Bellman equation 提供遞迴的公式,將繁瑣的求和替換為簡單的更新:immediate reward + discounted next‑state value
  • Monte‑Carlo 在完整回合後使用真實回報更新;TD learning 在每一步後使用 bootstrap 估計更新。
  • 在進入 Q‑Learning(第一個在 Atari 遊戲上達到人類水平的深度 RL 演算法)之前,必須精通這些概念。

課程後續步驟

本文宣告第二部分將涵蓋 Q‑Learning,並在兩個環境中提供實作練習:

  1. FrozenLake‑v1 (non‑slippery) – 從起點 (S) 移動到目標 (G),同時避免洞 (H)。
  2. Taxi‑v3 – 學習在格子城市中將乘客從一個位置運送到另一個位置。

鼓勵學生透過文章中的測驗測試自己的理解,並透過 Google Form 提供回饋。


持續學習,保持卓越!

Sources