OpenAI MADDPG: 學習合作、競爭與溝通
OpenAI 開發了 MADDPG,這是一種新型的強化學習 (RL) 演算法,專為需要代理人學習合作、競爭與溝通的多代理人環境而設計。透過利用「集中式學習與分散式執行」的機制,MADDPG 讓代理人能夠協調其行動並適應其他代理人的行為,從而克服了傳統分散式 RL 中固有的不穩定性。
集中式學習與分散式執行
MADDPG 擴展了 Deep Deterministic Policy Gradient (DDPG) 演算法,並結合了 actor-critic 強化學習技術。其核心創新在於為每個代理人使用一個集中式評論家 (centralized critic)。
- The Actor (執行者):模擬中的每個代理人皆扮演執行者,根據自身的觀察與對其他代理人行為的預測來決定採取哪些行動。
- The Centralized Critic (集中式評論家):在訓練期間,每個執行者都會配對一個評論家,該評論家可以獲取環境中所有代理人的觀察與行動。透過預測特定狀態下某個行動的預期未來獎勵(價值),此評論家能為執行者提供建議,告知應強化哪些行動。
- Decentralized Execution (分散式執行):代理人在測試階段不需要存取集中式評論家。他們僅根據自身的觀察與對其他代理人行為的預測來進行運作。
這種架構讓 MADDPG 能夠模擬任意的獎勵結構,包括獎勵相互對立的對抗性案例,並將不可預測的多代理人環境轉化為訓練過程中可預測的環境。
克服傳統 RL 的限制
傳統的分散式 RL 方法——例如 DDPG、actor-critic 學習與 deep Q-learning——在多代理人設定下表現掙扎,因為代理人必須在執行自身行動的同時,學習預測他人的行動。這會造成一個非平穩 (non-stationary) 的環境,即一個代理人的策略會隨著其他人的學習而改變,使得代理人難以收斂到穩定的策略。
此外,策略梯度法 (policy gradient methods) 通常表現出高變異性,當獎勵不一致時,很難學習到正確的策略。OpenAI 發現,僅僅在分散式 RL 中加入一個評論家,仍然無法解決如合作式溝通等任務,因為代理人在訓練期間需要考慮他人的行動,才能開發出協作策略。
實證結果與能力
OpenAI 在各種任務中測試了 MADDPG,其表現優於 DDPG。展示的能力包括:
- Coordinated Chasing (協調追逐):四個紅色代理人學會了組隊追逐兩個綠色代理人,而綠色代理人則學會了分散開來以避免被捕獲並到達目標(一個藍色圓圈)。
- Strategic Hiding (策略性隱藏):兩個代理人學會了分散開來,以向對手代理人隱藏其預期目的地。
- Cooperative Communication (合作式溝通):一個代理人學會了向另一個代理人傳達地標名稱。
- Collision Avoidance (碰撞避免):三個代理人協調其移動,以前往地標而不發生碰撞。
對 AGI 的啟示
OpenAI 將多代理人環境視為邁向通用人工智慧 (AGI) 的關鍵墊腳石,主要基於兩個原因:
- Natural Curriculum (自然課程):環境的難度會隨著競爭對手的技能水平自動調整。如果代理人與自身的克隆體競爭,環境的難度將精確地匹配其目前的技能水平。
- Lack of Stable Equilibrium (缺乏穩定均衡):由於始終存在變得更聰明的壓力以超越競爭對手,因此在這些環境中,代理人的智能水平沒有上限。
透過將深度學習處理複雜視覺輸入的能力與 RL 學習長期行為的能力相結合,MADDPG 能夠在無需預知環境動態知識的情況下,研究高維度環境中的溝通與語言。