OpenAI 具備對手學習意識的學習 (LOLA)

TL;DR

OpenAI 已經提出具備對手學習意識的學習 (LOLA),這是一種專為多智能體環境設計的強化學習方法。LOLA 使智能體能夠主動塑造對手預期的學習,從而在如囚徒困境的迭代版本(IPD)等社會困境中促進合作的出現,並在如重複匹配硬幣(Repeated Matching Pennies)等零和博弈中實現納什均衡的收斂。

多智能體 RL 中的非平穩性挑戰

在多智能體強化學習(MARL)中,環境會變得非平穩,因為所有智能體同時學習並更新其策略。這種非平穩性經常導致訓練不穩定或產生不理想的最終結果。此挑戰適用於廣泛的環境,包括深度多智能體 RL、階層 RL、基於高階梯度的方法以及生成對抗網路(GANs)。

LOLA 演算法:塑造對手學習

具備對手學習意識的學習 (LOLA) 是一種學習規則,它明確考慮了一個智能體當前策略對其他智能體將如何更新其參數的影響。與將對手視為環境的一部分不同,LOLA 智能體會預期對手未來的參數更新,並優化自身策略以塑造該學習過程。

Key technical implementation details include:

  • 參數更新規則: LOLA 更新規則包含一個特定項,用於考慮一個智能體的策略對其他智能體預期參數更新的影響。
  • 可擴展性: LOLA 更新規則可以透過策略梯度估計器的擴展高效計算。這使得該方法適合於無模型強化學習(model-free RL),從而能夠擴展到大參數空間、大輸入空間以及非線性函數近似器。

性能與結果

OpenAI 研究人員應用 LOLALOLA 智能體在數個基準測試中表現出卓越的性能:

  • 迭代囚徒困境 (IPD): 在兩個 LOLA 智能體的互動中,出現了以牙還牙策略和合作,而獨立學習的智能體則未能做到。LOLA 智能體相比於天真的學習者也獲得了更高的回報,並對高階梯度方法的利用具有穩健性。
  • 重複匹配硬幣: 在此零和博弈中,LOLA 智能體收斂到納什均衡。
  • 循環賽: 在對現有文獻中多智能體學習算法的各種競賽中,LOLA 智能體在 IPD 上獲得了最高的平均回報。
  • 網格世界任務: 在一個內嵌社會困境的網格世界任務中,LOLA 智能體使用遞迴策略和對手建模,以利己為出發點學習合作。

對多智能體系統的影響

通過明確考慮其他智能體的學習,LOLA 提供了一種機制,使智能體能夠在個體自利通常導致次優結果的環境中學習合作。此方法將智能體的視角從對當前策略的反應轉移為專注於影響同一對手未來的學習軌跡。

Sources