OpenAI 機器人研究的材料

OpenAI 已發布八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER)。這些工具旨在促進可轉移至實體機器人的模型訓練,特別針對比現有 MuJoCo 連續控制環境更具挑戰性的操作任務。

Simulated Robotics Environments

OpenAI 使用 MuJoCo 物理模擬器為 Gym 提供了八個新環境,分屬兩個機器人平台:

Fetch Research Platform

  • FetchReach-v0: 機器人必須將其末端執行器移動到特定目標位置。
  • FetchSlide-v0: 機器人必須擊穿桌面上的冰球,使其滑動並停在期望的目標位置。
  • FetchPush-v0: 機器人必須推動一個箱子,直到它到達期望的目標位置。
  • FetchPickAndPlace-v0: 機器人必須從桌子上拿起一個箱子,並將其移動到桌子上方的目標位置。

ShadowHand Robot

  • HandReach-v0: 機器人必須使用其拇指和選定的手指,在手掌上方的目標位置相會。
  • HandManipulateBlock-v0: 機器人必須操作一個塊體,以達到期望的位置和旋轉。
  • HandManipulateEgg-v0: 機器人必須操作一個蛋,以達到期望的位置和旋轉。
  • HandManipulatePen-v0: 機器人必須操作一支筆,以達到期望的位置和旋轉。

Goal-Based Learning and Sparse Rewards

所有新環境都引入了「目標」概念,例如目標位置或方向。預設情況下,這些環境使用稀疏獎勵:如果在容忍範圍內達成目標則獎勵值為 0,否則為 -1。雖然存在密集獎勵變體,但 OpenAI 鼓勵使用稀疏獎勵,因為它們對真實的機器人應用更具現實性。

Hindsight Experience Replay (HER)

為了解決從稀疏獎勵學習的困難——代理可能在多次嘗試中持續收到 -1 訊號——OpenAI 發布了 Baselines 實作的 Hindsight Experience Replay (HER)。

HER 允許代理通過將原始目標替換為在情節中實際達成的目標,從失敗中學習。假設達成的狀態就是預期目標,代理即使在失敗主要任務時也會獲得正向學習訊號。隨著時間推移,這使得代理能學會如何達成任意目標,包括原始目標。

HER 是一種離策略強化學習算法,可以與其他離策略方法結合,例如 Deep Deterministic Policy Gradient (DDPG)。在測試中,DDPG + HER 與稀疏獎勵的組合顯著優於純粹的 DDPG,甚至優於 DDPG + HER 與密集獎勵的組合,在具有挑戰性的任務如 HandManipulateBlockRotateXYZ-v0 上尤為顯著。

Future Research Directions for HER

OpenAI 確定了若干改進 HER 與一般強化學習的領域:

  • Automatic Goal Creation: 學習一種選擇後見目標的策略,而不是使用硬編碼方法。
  • Unbiased HER: 利用重要性採樣推導出無偏的 HER 版本,以防止目標替換可能導致的不穩定。
  • HER + HRL: 將 HER 與階層強化學習 (HRL) 結合,以將後見應用於由更高層策略生成的動作。
  • Richer Value Functions: 將價值函數條件化於額外輸入,如成功閾值或折扣因子。
  • Faster Information Propagation: 調查目標網絡的替代方案,以在不犧牲穩定性的情況下加速訓練。
  • HER + Multi-step Returns: 尋找方法使用多步回報,儘管目標替換具有離策略特性。
  • On-policy HER: 探索透過重要性採樣將 HER 與穩定的 On-policy 算法(如 PPO)結合。
  • Sample Efficiency: 設計算法,即使動作頻率增加至無限大時仍能保持性能。
  • Integration: 將 HER 與 優先經驗回放、分布式強化學習 或 熵正則化強化學習 等進展結合。

Gym API Changes for Goal-Based Environments

為支援這些環境,Gym API 已根據以下變更進行更新:

  • Observation Space: 目標導向環境現在使用 gym.spaces.Dict 觀測空間,包含 desired_goalachieved_goalobservation(機器人的狀態)。
  • Reward Function Exposure: 環境的獎勵函數現在已被公開,使得算法可以根據替換的目標重新計算獎勵。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch