OpenAI 大規模好奇心驅動學習研究

OpenAI 發布了一項關於好奇心驅動學習的研究,展示了代理人能在沒有任何外部獎勵的情況下學習複雜行為並解決環境。透過將預測誤差作為內在獎勵訊號,這些代理人在好奇心驅動目標與傳統人工設計的外在獎勵之間展現出高度的一致性。

內在好奇心作為獎勵訊號

強化學習(RL)通常依賴由人類設計的外在獎勵來指導代理人的行為。然而,為每個環境打造密集且人工設計的獎勵並不具備可擴展性。為了解決此問題,研究團隊開發了一種內在於代理人的獎勵函數,將好奇心定義為代理人對環境內部模型的預測誤差。

當代理人遇到其內部模型無法準確預測的狀態或轉移時,會獲得獎勵,從而鼓勵探索新穎或不熟悉的領域。

大規模跨 54 個環境的評估

OpenAI 在包括 Atari 遊戲套件在內的 54 個標準基準環境中,進行了首次純粹好奇心驅動學習的大規模研究。這些代理人在沒有任何外在獎勵的情況下進行訓練,亦即它們未收到如遊戲分數或點數等訊號。

結果顯示出令人驚訝的良好表現,研究亦發現內在好奇心目標與這些遊戲中通常使用的外在獎勵之間具有高度的一致性。

特徵空間與泛化

研究探討了不同特徵空間如何用於計算預測誤差。研究發現:

  • 隨機特徵: 這對許多流行的 RL 遊戲基準已足夠。
  • 學習特徵: 這提供了更好的泛化能力,特別是當代理人需要在《Super Mario Bros.》中導航全新遊戲關卡時。

隨機環境中的限制

雖然好奇心驅動學習在許多基準中取得成功,研究人員仍發現在隨機(random)設定下,基於預測的獎勵存在限制。在轉移本質上不可預測的環境中,代理人可能會被不可預測的 ruangan 所困住,而不是尋求有意義的探索。

結論

此研究顯示,好奇心驅動學習在許多情況下能有效取代外在獎勵,且在使用學習特徵時,代理人對新關卡的泛化能力得到提升。然而,隨機性的挑戰仍是基於預測的內在獎勵的主要限制。

Sources