OpenAI 演化策略梯度 (EPG)
OpenAI 已推出演化策略梯度 (EPG),這是一種元學習方法,透過演化損失函數而非策略,使強化學習 (RL) 代理人能更有效率地學習新任務。此方法讓代理人不必從「白紙」開始,藉由利用演化的損失函數來編碼在相似任務間的進展感。
演化損失函數以進行元學習
EPG 專注於演化損失函數本身,以提升學習效率與泛化能力。這與其他元學習方法不同,後者著重於學習循環策略或策略初始化。OpenAI 指出,循環策略往往對特定任務過度擬合,而策略初始化在探索方面的表達能力有限。
損失函數被假設為最有可能在截然不同的任務間泛化的對象。這基於與手工設計損失函數相同的邏輯,例如在近端策略最佳化 (PPO) 中使用的損失函數,能廣泛應用於各種問題,如 Atari 遊戲與機器人控制。
泛化效能與「螞蟻」實驗
為了測試 EPG 的泛化能力,OpenAI 進行了一項實驗,使用代理人(「螞蟻」)負責走向隨機位於競技場右半部的目標。
- Training: EPG 損失函數被演化成對競技場右半部的目標有效。
- Testing: 在凍結損失函數後,代理人被指派左半部的目標——這是訓練分布之外的任務。
- Outcome: 代理人成功學會向左走,展示了對訓練分布之外任務的泛化能力。
相比之下,RL2 演算法(學習能適應新任務的策略)在此情境中失敗。雖然 RL2 在右半部目標上表現成功,但在面對左半部目標時卻明顯失敗,仍持續向右走。這顯示 RL2 對特定訓練任務過度擬合。
目前的限制與效能與泛化之間的取捨
雖然 EPG 在任務族內的泛化展現出前景,但目前仍面臨效能與損失函數泛化性之間的取捨。
- Task Family Limitation: EPG 目前只能訓練出對單一小任務族(例如左右行走)有效的損失函數。
- Comparison to Standard RL: 標準 RL 的損失函數具有高度通用性;相同的損失函數可用於截然不同的技能,例如玩《太空侵略者》。然而,EPG 的損失函數尚未足夠通用,無法跨越極為不同的任務。
OpenAI 結論指出,EPG 透過犧牲標準 RL 方法所具備的廣泛泛化性,換取在特定任務族內的效能提升。
Sources
- OriginalEvolved Policy Gradients