OpenAI MADDPG: 學習合作、競爭與溝通

OpenAI 開發了 MADDPG,這是一種新型的強化學習 (RL) 演算法,專為需要代理人學習合作、競爭與溝通的多代理人環境而設計。透過利用「集中式學習與分散式執行」的機制,MADDPG 讓代理人能夠協調其行動並適應其他代理人的行為,從而克服了傳統分散式 RL 中固有的不穩定性。

集中式學習與分散式執行

MADDPG 擴展了 Deep Deterministic Policy Gradient (DDPG) 演算法,並結合了 actor-critic 強化學習技術。其核心創新在於為每個代理人使用一個集中式評論家 (centralized critic)。

  • The Actor (執行者):模擬中的每個代理人皆扮演執行者,根據自身的觀察與對其他代理人行為的預測來決定採取哪些行動。
  • The Centralized Critic (集中式評論家):在訓練期間,每個執行者都會配對一個評論家,該評論家可以獲取環境中所有代理人的觀察與行動。透過預測特定狀態下某個行動的預期未來獎勵(價值),此評論家能為執行者提供建議,告知應強化哪些行動。
  • Decentralized Execution (分散式執行):代理人在測試階段不需要存取集中式評論家。他們僅根據自身的觀察與對其他代理人行為的預測來進行運作。

這種架構讓 MADDPG 能夠模擬任意的獎勵結構,包括獎勵相互對立的對抗性案例,並將不可預測的多代理人環境轉化為訓練過程中可預測的環境。

克服傳統 RL 的限制

傳統的分散式 RL 方法——例如 DDPG、actor-critic 學習與 deep Q-learning——在多代理人設定下表現掙扎,因為代理人必須在執行自身行動的同時,學習預測他人的行動。這會造成一個非平穩 (non-stationary) 的環境,即一個代理人的策略會隨著其他人的學習而改變,使得代理人難以收斂到穩定的策略。

此外,策略梯度法 (policy gradient methods) 通常表現出高變異性,當獎勵不一致時,很難學習到正確的策略。OpenAI 發現,僅僅在分散式 RL 中加入一個評論家,仍然無法解決如合作式溝通等任務,因為代理人在訓練期間需要考慮他人的行動,才能開發出協作策略。

實證結果與能力

OpenAI 在各種任務中測試了 MADDPG,其表現優於 DDPG。展示的能力包括:

  • Coordinated Chasing (協調追逐):四個紅色代理人學會了組隊追逐兩個綠色代理人,而綠色代理人則學會了分散開來以避免被捕獲並到達目標(一個藍色圓圈)。
  • Strategic Hiding (策略性隱藏):兩個代理人學會了分散開來,以向對手代理人隱藏其預期目的地。
  • Cooperative Communication (合作式溝通):一個代理人學會了向另一個代理人傳達地標名稱。
  • Collision Avoidance (碰撞避免):三個代理人協調其移動,以前往地標而不發生碰撞。

對 AGI 的啟示

OpenAI 將多代理人環境視為邁向通用人工智慧 (AGI) 的關鍵墊腳石,主要基於兩個原因:

  1. Natural Curriculum (自然課程):環境的難度會隨著競爭對手的技能水平自動調整。如果代理人與自身的克隆體競爭,環境的難度將精確地匹配其目前的技能水平。
    1. Lack of Stable Equilibrium (缺乏穩定均衡):由於始終存在變得更聰明的壓力以超越競爭對手,因此在這些環境中,代理人的智能水平沒有上限。

透過將深度學習處理複雜視覺輸入的能力與 RL 學習長期行為的能力相結合,MADDPG 能夠在無需預知環境動態知識的情況下,研究高維度環境中的溝通與語言。

Sources