Transitive RL: 透過分治法擴展離策略強化學習

BAIR 已提出 Transitive RL (TRL),一種新的強化學習演算法,以「分治法」範式取代傳統的時間差分 (TD) 學習。此方法透過以對數而非線性方式減少 Bellman 遞迴次數,使離策略強化學習能夠擴展至複雜的長時域任務,從而無需調整 n-step 超參數。

離策略強化學習的可擴展性挑戰

離策略強化學習在資料收集成本高昂的領域中至關重要,例如機器人、醫療保健和對話系統,因為它允許使用任何資料,包括舊經驗和人類示範。然而,由於當前價值學習範式的限制,將離策略強化學習擴展至長時域任務仍然具有挑戰性:

  • 時間差分 (TD) 學習: 傳統 Q-learning 依賴於自助法(bootstrapping),其中下一個值 $Q(s', a')$ 的誤差會傳播到當前值 $Q(s, a)$。這些誤差會在整個時域中累積,阻礙可擴展性。
  • 蒙特卡羅 (MC) 回報: 雖然 n-step TD 學習 (TD-n) 以常數因子 $n$ 減少 Bellman 遞迴次數,但它並未根本解決誤差累積問題。為減少偏差而增加 $n$ 常導致高方差和次優結果,需要為每個任務謹慎調整。

分治法範式

Transitive RL 引入了一種第三種範式,軟體將軌跡分割為兩個等長的片段,並結合它們的值來更新完整軌跡的值。該方法以對數方式減少 Bellman 遞迴次數,避免了純 Monte Carlo 方法的高方差以及 n-step TD 的調整需求。

應用於目標條件強化學習

TRL 專門針對 目標條件強化學習 實現,其目標是學習一種能夠從任意狀態到達任意其他狀態的策略。此設置基於最短路徑距離 $d^*(s, g)$ 的三角不等式提供了自然結構:

$$d^(s, g) \le d^(s, w) + d^*(w, g)$$

就稀疏獎勵的價值函數 $V$ 而言,這轉化為一個「傳遞」的 Bellman 更新規則:

$$V(s, g) \leftarrow \begin{cases} \gamma^0 & \text{if } s=g \ \gamma^1 & \text{if } (s, g) \in E \ \max_{w \in S} V(s, w)V(w, g) & \text{otherwise} \end{cases}$$

此規則允許使用兩個較小的值 $V(s, w)$ 和 $V(w, g)$ 來更新 $V(s, g)$ 的值,其中 $w$ 是一個最佳中點或子目標。

TRL 的實際實作

為使分治法價值學習在具有大狀態空間的連續環境中變得實用,TRL 採用了兩項關鍵技術方案來解決尋找最佳子目標 $w$ 的問題:

  1. 受限搜索空間: 而不是搜索整個狀態空間,TRL 將 $w$ 的搜索限制為在 $s$ 和 $g$ 之間的資料軌跡中出現的狀態。
  2. 期望回歸: 為防止通常由 $\max$ 算子導致的價值過估計,TRL 透過期望回歸使用「軟」argmax。該算法最小化以下損失:

$$ \mathbb{E}[\ell_{2\kappa}(V(s_i, s_j) - \bar{V}(s_i, s_k)\bar{V}(s_k, s_j))] $$

其中 $\bar{V}$ 是目標價值網絡,$\ell_{2\kappa}$ 是具有期望值 $\kappa$ 的期望損失,在採樣軌跡中所有滿足 $i \le k \le j$ 的元組 $(s_i, s_k, s_j)$ 上計算。

性能與基準測試

TRL 在 OGBench 基準測試上進行了離線目標條件強化學習的評估,特別針對涉及 1B 大小資料集且環境步數上限達 3,000humanoidmazepuzzle 任務的最難版本。

  • 優於基線: TRL 在多數任務上超越了 TD、MC 和準度量學習類別中的強基線。
  • 消除超參數調整: TRL 在所有任務上匹配了最佳個別調整的 n-step TD 學習 (TD-n) 的性能,而無需使用者指定 $n$ 的值。

未來方向

儘管 TRL 目前假設動態為確定性,但 BAIR 指出了未來發展的幾個方向:

  • 泛化: 將 TRL 擴展到目標條件強化學習以外的常規基於獎勵的強化學習任務。
  • 隨機性: 調整演算法以處理隨機環境和部分可觀測性,潛在地使用「隨機」三角不等式。
  • 優化: 改進子目標候選選擇,超越同一軌跡,並進一步穩定訓練。

Sources