學習合作、競爭與溝通 – OpenAI 2017 研究公告

TL;DR

OpenAI 發布了 MADDPG 演算法,用於多智能體強化學習中的集中學習與分散執行,顯示智能體能夠學會比先前方法更好的合作、競爭與溝通。

Introduction

多智能體環境中,智能體為爭奪資源而競爭,被視為通往 AGI 的踏腳石。它們提供了一種自然的課程——難度與競爭者的技能相匹配——且沒有穩定的平衡點,從而產生持續的改進壓力。

Where traditional RL struggles

傳統的去中心化強化學習方法,如 DDPG、actor‑critic 與深度 Q‑learning,在多智能體環境中會遇到困難,因為每個智能體必須同時嘗試預測其他智能體的行動並自行行動,尤其是在競爭情境下。策略梯度方法會遭受高方差問題,加入評論家能提升穩定性,但仍無法解決如合作溝通之類的任務。在訓練過程中考慮其他智能體的行動對學習協作策略至關重要。

MADDPG algorithm

我們開發了 MADDPG(多智能體深度確定性策略梯度)以實現集中學習與分散執行。該算法透過借鑑 actor‑critic 技術來擴展 DDPG。

  • 每個智能體被視為一個「actor」,它會從「critic」處獲得建議,以決定在訓練期間要強化哪些動作。
  • 在標準強化學習中,評論家會預測在特定狀態下某個動作的價值(預期未來回報),然後 actor 利用此價值來更新其策略。
  • 為使多智能體學習變得可行,我們增強了評論家,使其能夠存取 所有 智能體的觀測與動作,如圖所示。
  • 在測試時,智能體 不需要 中央評論家;它們根據自身的觀測以及對其他智能體行動的預測來行動。
  • 因為每個智能體都會獨立學習一個中央評論家,此方法能夠模擬任意的獎勵結構,包括獎勵互相對立的對抗情況。

Experimental results

我們在多種任務上測試了 MADDPG,發現它在所有任務上的表現都優於 DDPG。隨附的動畫示範:

  • 兩個 AI 智能體學習前往特定位置,同時分散開來以隱藏其預定位置,避免被對抗智能體發現。
  • 一個智能體向另一個智能體傳送地標的名稱。
  • 三個智能體協調前往地標,且不發生碰撞。

Initial research challenges

在 MADDPG 出現之前,使用去中心化技術時,我們觀察到當說話者發送關於前往何處的不一致訊息時,聆聽者常會學會忽略說話者。聆聽者會將與說話者訊息相關的所有權重設為零,實際上使自己變成「聾子」。一旦發生此情況,恢復變得困難,因為說話者無法得到關於其訊息是否正確的回饋。

我們嘗試了來自最近一個階層式強化學習專案的技術,該技術迫使聆聽者納入說話者的話語,但這僅讓聆聽者注意,而未幫助說話者學習何種話語才是相關的。

MADDPG 中的集中評論家透過協助說話者學習哪些話語可能與其他智能體的行動相關來解決此問題。

Next steps

智能體建模在 AI 研究中有著悠久的歷史,先前的工作主要集中在時間步數少且狀態空間小的遊戲上。深度學習現在能夠處理複雜的視覺輸入,而強化學習則提供了學習長期行為的工具。

使用 MADDPG,我們可以同時訓練多個智能體,而無需它們了解環境的動態,這為涉及溝通、語言以及從高維資訊學習的更廣泛問題打開了大門。

對演化智能體感興趣的研究者受邀考慮加入 OpenAI 的機會。

Authors

Ryan Lowe, Igor Mordatch, Pieter Abbeel, Yi Wu, Aviv Tamar, Jean Harb

Sources