OpenAI 多目標強化學習機器人環境
OpenAI 已推出一套具挑戰性的連續控制任務,旨在推進多目標強化學習(RL)領域。這些環境已與 OpenAI Gym 整合,提供了一個標準化的框架,用於測試必須根據額外輸入指令學習實現各種目標的代理。
機器人環境與硬體
這套新環境專注於基於現有機器人硬體的連續控制任務。任務根據其模擬的硬體進行分類:
- Fetch 機械臂: 任務包括推動、滑動以及撿取放置操作。
- Shadow 靈巧手: 任務專注於手內物體操作。
多目標 RL 框架
這些環境採用多目標強化學習框架。在此設置中,代理會獲得一個額外輸入,指定其旨在實現的目標。這與單目標 RL 不同,在單目標 RL 中,代理學習特定任務。
為維持嚴格的測試環境,此套件中的所有任務都具有稀疏二元獎勵,意謂著代理僅在目標成功實現時才會獲得獎勵,而不是受密集獎勵函數的引導。
研究目標與後見經驗重播
在環境發布之後,OpenAI 的技術報告提出了改進 RL 演算法的具體研究方向。此研究請求的主要焦點是改進多目標 RL 和後見經驗重播(HER)。
HER 是一種技術,旨在通過將達到的狀態視為虛擬目標來幫助代理從失敗中學習,從而使代理能夠從每個軌跡中提取學習訊號,即使那些沒有實現原始預期目標的軌跡也是如此。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch