OpenAI 後見經驗重播
OpenAI 提出了後見經驗重播(HER),一種強化學習(RL)技術,旨在克服稀疏獎勵的挑戰。透過將失敗視為非預期目標的成功完成,使智能體能夠從失敗中學習,HER 在不需要複雜獎勵工程的情況下實現了樣本高效的學習。
解決稀疏獎勵問題
在許多強化學習環境中,獎勵是稀疏且二元的——意謂著智能體只有在任務完美完成時才會獲得正向訊號。這常常使訓練變得困難,因為智能體可能很少遇到獎勵,從而缺乏學習所需的資料。
後見經驗重播透過將每一次經驗視為學習機會來解決此問題。智能體不僅從目標達成的情節中學習,還會回顧其實際達到的狀態,並將該狀態視為該特定情節的預期目標。此過程充當一種隱性課程,使智能體在最終掌握主要目標之前,先了解如何到達各種狀態。
技術實作與相容性
HER 設計為靈活且可與任意離線策略強化學習演算法結合使用。由於它修改了經驗在記憶緩衝區中的存儲和重播方式,因此不需要對核心 RL 演算法本身進行變更。
機械手臂操作的實驗結果
OpenAI 透過機械手臂執行三種不同操作任務的實驗,展示了 HER 的有效性:
- 推送: 將物體移動到目標位置。
- 滑動: 將物體在表面上滑動。
- 撿取放置: 提起並將物體移動到特定目的地。
在此些實驗中,研究者僅使用二元獎勵,指示任務是否完成。消融研究證實,後見經驗重播是使得在這些具有挑戰性的環境中訓練成為可能的關鍵因素。
模擬到真實的遷移
該研究表明,使用 HER 在物理模擬中訓練的策略可以成功部署到實體機器人上。智能體能夠將在模擬中學習的技能遷移到真實世界,並成功完成任務,證明了該技術在合成環境之外環境中的實用性。
Sources
- OriginalHindsight Experience Replay