OpenAI 與 Oxford 推出 LOLA 用於多智能體強化學習

OpenAI 與牛津大學已推出 Learning with Opponent-Learning Awareness (LOLA),這是一種強化學習(RL)框架,使得智能體在更新自身策略時能夠考慮其他智能體的學習過程。此方法使智能體能夠在競爭或合作遊戲中發現互惠策略,克服了標準深度 RL 方法常導致自私、次優結果的限制。

強化學習中的心理理論

LOLA 實作了一種「心理理論」的形式,使得智能體能夠推理其自身行為如何影響其他智能體的未來行為。在傳統的深度多智能體強化學習中,智能體通常將其他學習智能體視為環境的靜態部分——類似於樹或牆——忽略了其他智能體也在適應其策略的事實。

LOLA 透過建模另一個智能體(例如「Bob」)的參數更新如何依賴於自身智能體的策略(例如「Alice」)來區分自己。透過理解這種關係,Alice 可以更新她的策略,以塑造 Bob 的學習步驟,使其更有利於她自己的目標。

技術實現與效能

LOLA 效能的核心是將特定的數學項納入策略更新過程:

$$ \left(\left(\frac{\partial V^{1} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{2}}\right)^{T} \frac{\partial^{2} V^{2} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{1} \partial \theta_{i}^{2}} \cdot \delta \eta\right) $$

此項使得智能體能夠明確考慮其他智能體的學習軌跡。此機制使得 LOLA 智能體能夠在最先進的深度 RL 方法(如 Independent PPO)失效的環境中成功。儘管 Independent PPO 智能體通常會學習忽略他人目標的自私行為,LOLA 智能體則基於納入他人目標的自身利益行事,無需手工規則或預先設定的合作環境。

在硬幣遊戲與囚徒困境中的應用

LOLA 智能體已展示出在複雜情境中發現有效互惠策略的能力,例如迭代囚徒困境與硬幣遊戲。

在硬幣遊戲中,兩個智能體(紅色和藍色)競爭撿取硬幣。雖然任何硬幣都提供一分,但撿取顏色相反的硬幣會給該智能體帶來 -2 分的懲罰。如果智能體貪婪地撿走所有硬幣,平均得分為零。然而,LOLA 智能體學會主要撿取自己顏色的硬幣,透過塑造其他智能體的行為以促進合作,使雙方都能獲得高分。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch