OpenAI 機器人研究的材料
OpenAI 已發布八個模擬機器人環境以及 Baselines 實作的 Hindsight Experience Replay (HER)。這些工具旨在促進可轉移至實體機器人的模型訓練,特別針對比現有 MuJoCo 連續控制環境更具挑戰性的操作任務。
Simulated Robotics Environments
OpenAI 使用 MuJoCo 物理模擬器為 Gym 提供了八個新環境,分屬兩個機器人平台:
Fetch Research Platform
- FetchReach-v0: 機器人必須將其末端執行器移動到特定目標位置。
- FetchSlide-v0: 機器人必須擊穿桌面上的冰球,使其滑動並停在期望的目標位置。
- FetchPush-v0: 機器人必須推動一個箱子,直到它到達期望的目標位置。
- FetchPickAndPlace-v0: 機器人必須從桌子上拿起一個箱子,並將其移動到桌子上方的目標位置。
ShadowHand Robot
- HandReach-v0: 機器人必須使用其拇指和選定的手指,在手掌上方的目標位置相會。
- HandManipulateBlock-v0: 機器人必須操作一個塊體,以達到期望的位置和旋轉。
- HandManipulateEgg-v0: 機器人必須操作一個蛋,以達到期望的位置和旋轉。
- HandManipulatePen-v0: 機器人必須操作一支筆,以達到期望的位置和旋轉。
Goal-Based Learning and Sparse Rewards
所有新環境都引入了「目標」概念,例如目標位置或方向。預設情況下,這些環境使用稀疏獎勵:如果在容忍範圍內達成目標則獎勵值為 0,否則為 -1。雖然存在密集獎勵變體,但 OpenAI 鼓勵使用稀疏獎勵,因為它們對真實的機器人應用更具現實性。
Hindsight Experience Replay (HER)
為了解決從稀疏獎勵學習的困難——代理可能在多次嘗試中持續收到 -1 訊號——OpenAI 發布了 Baselines 實作的 Hindsight Experience Replay (HER)。
HER 允許代理通過將原始目標替換為在情節中實際達成的目標,從失敗中學習。假設達成的狀態就是預期目標,代理即使在失敗主要任務時也會獲得正向學習訊號。隨著時間推移,這使得代理能學會如何達成任意目標,包括原始目標。
HER 是一種離策略強化學習算法,可以與其他離策略方法結合,例如 Deep Deterministic Policy Gradient (DDPG)。在測試中,DDPG + HER 與稀疏獎勵的組合顯著優於純粹的 DDPG,甚至優於 DDPG + HER 與密集獎勵的組合,在具有挑戰性的任務如 HandManipulateBlockRotateXYZ-v0 上尤為顯著。
Future Research Directions for HER
OpenAI 確定了若干改進 HER 與一般強化學習的領域:
- Automatic Goal Creation: 學習一種選擇後見目標的策略,而不是使用硬編碼方法。
- Unbiased HER: 利用重要性採樣推導出無偏的 HER 版本,以防止目標替換可能導致的不穩定。
- HER + HRL: 將 HER 與階層強化學習 (HRL) 結合,以將後見應用於由更高層策略生成的動作。
- Richer Value Functions: 將價值函數條件化於額外輸入,如成功閾值或折扣因子。
- Faster Information Propagation: 調查目標網絡的替代方案,以在不犧牲穩定性的情況下加速訓練。
- HER + Multi-step Returns: 尋找方法使用多步回報,儘管目標替換具有離策略特性。
- On-policy HER: 探索透過重要性採樣將 HER 與穩定的 On-policy 算法(如 PPO)結合。
- Sample Efficiency: 設計算法,即使動作頻率增加至無限大時仍能保持性能。
- Integration: 將 HER 與 優先經驗回放、分布式強化學習 或 熵正則化強化學習 等進展結合。
Gym API Changes for Goal-Based Environments
為支援這些環境,Gym API 已根據以下變更進行更新:
- Observation Space: 目標導向環境現在使用
gym.spaces.Dict觀測空間,包含desired_goal、achieved_goal和observation(機器人的狀態)。 - Reward Function Exposure: 環境的獎勵函數現在已被公開,使得算法可以根據替換的目標重新計算獎勵。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch