演化策略作為強化學習的可擴展替代方案
OpenAI 發現,演化策略(ES)是一種歷經數十年的優化技術,在 Atari 和 MuJoCo 等現代基準測試上與標準強化學習(RL)的表現具有競爭力。ES 透過消除對反向傳播的需求、簡化分佈式擴展以及提升對稀疏獎勵的鲁棒性,克服了傳統 RL 的若干不便。
演化策略 vs. 強化學習
演化策略(ES)作為一種黑箱隨機優化技術運作。與傳統強化學習(RL)不同,後者通過在動作空間中注入噪聲並使用反向傳播來更新參數來優化策略,ES 則直接將噪聲注入參數空間。
ES 演算法
ES 將策略網絡視為一個黑箱,其中一組參數(權重)作為輸入,單一總獎勵作為輸出。優化過程遵循「猜測與檢查」循環:
- 擾動:算法取得參數向量,並通過添加高斯噪聲生成一組略有不同的版本作為族群。
- 評估:每個候選者在環境中獨立運行以計算總獎勵。
- 更新:參數向量更新為候選者的加權和,權重與所獲得的獎勵成比例。
此過程在數學上等價於通過在隨機方向上使用有限差分來估計參數空間中預期獎勵的梯度。
ES 的技術優勢
ES 相較於傳統強化學習算法提供了若干運營優勢:
- 消除反向傳播:因為 ES 只需要策略的前向傳播,它不需要反向傳播或價值函數估計。這使得程式碼在實際上快 2-3 倍,並允許使用不可微分的策略,例如二進位網路或如路徑尋找這樣的複雜模組。
- 高度可並行化:ES 工作器只需通信少量標量(獎勵),而無需同步整個參數向量。透過控制隨機種子,工作器可以在本地重建擾動。這使得在擴展到數千個 CPU 核心時能實現線性加速。
- 增強鲁棒性:ES 對經常導致 RL 失敗的超參數不那麼敏感。例如,ES 在 Atari 遊戲的不同幀跳過設置下保持一致的表現,而 RL 不是「無尺度的」。
- 一致探索:通過使用確定性策略,ES 避免了政策梯度方法中常見的「隨機抖動」,從而允許對環境進行更一致的探索。
- 長期信用分配:當情節包含許多時間步、動作具有持久影響,或缺乏可靠的價值函數估計時,ES 特別有效。
效能與可擴展性基準測試
OpenAI 將 ES 與標準強化學習基準進行比較,具體為 MuJoCo 控制任務和 Atari 遊戲,重點關注資料效率和牆鐘時間。
MuJoCo 控制任務
雖然 ES 在資料效率上不如 TRPO(約慢 10 倍),但由於其可擴展性,在牆鐘時間上快很多。使用 80 台機器上的 1,440 個 CPU,ES 在 10 分鐘內訓練出一個 3D MuJoCo 人形行走者,而使用 32 個核心的 A3C 大約需要 10 小時。
Atari 遊戲玩法
使用 720 個核心,ES 在 Atari 遊戲上達到與 A3C 相當的表現,將訓練時間從一天(A3C 在 32 個核心上)縮短至僅一小時。
實際限制與適用範圍
ES 並非所有機器學習技術的普遍替代方案。OpenAI 指出了兩項主要限制:
- 參數敏感性:為了讓 ES 產生梯度信號,對參數添加噪聲必須導致不同的行為結果。OpenAI 發現虛擬批次標準化有助於緩解此問題,但仍需進一步研究網路參數化。
- 稀疏獎勵挑戰:在如 Montezuma’s Revenge 這樣的環境中,獲得獎勵需要特定的動作序列(例如尋找鑰匙),強化學習中的隨機動作偶爾可能成功,而 ES 中的隨機參數噪聲則可能不會。
監督學習的注意事項:ES 不適合用於監督學習任務(例如圖像分類)。在 MNIST 數字識別任務的測試中,ES 的速度可能比反向傳播慢多達 1,000 倍,因為監督學習允許計算精確梯度,使得 ES 基於抽樣的方法效率低下。