OpenAI 從多智能體互動中展現出的工具使用能力

多智能體競爭驅動工具使用的湧現

OpenAI 證明了智能體可以在模擬的躲貓貓環境中,透過多智能體協同適應(multi-agent co-adaptation)發現漸進式複雜的工具使用與策略。藉由在競爭環境中訓練智能體(躲藏者試圖避免視線接觸,而搜尋者試圖維持視線接觸),智能體開發出了一系列六種不同的策略與反制策略。這種湧現的複雜性是在沒有明確的工具互動激勵下發生的,這表明多智能體競爭可以透過自我監督的方式產生智能行為。

躲貓貓環境

智能體在一個基於物理的模擬中運行,具有以下能力與限制:

  • 移動: 智能體可以施加力量在 x 和 y 方向移動,並沿著 z 軸旋轉。
  • 視覺: 智能體可以在其視線的前向圓錐區域內看到物體。
  • 感測: 類似 lidar 的感測器提供附近牆壁、物體和其他智能體的距離數據。
  • 物體互動: 智能體可以抓取、移動和鎖定物體。只有鎖定物體的團隊才能解鎖它。
  • 遊戲結構: 遊戲包含一個準備階段,在此階段搜尋者被固定不動,讓躲藏者可以佈置其環境。

獎勵結構: 獎勵是基於團隊的。如果所有躲藏者都保持隱藏,躲藏者獲得 +1,若有任何躲藏者被看見,則獲得 -1。搜尋者獲得相反的獎勵(若所有躲藏者都隱藏,則獲得 -1,否則獲得 +1)。智能體因移動到遊戲區域外太遠而受到懲罰。

自動課程與策略湧現

透過稱為「自動課程」(autocurriculum)的過程,智能體之間的競爭創造了策略與反制策略的循環。當一個團隊找到獲勝方法時,它會為對手團隊創造新的適應壓力。

在簡單的環境中(2 個躲藏者、2 個搜尋者、2 個箱子、1 個斜坡,以及一個有 1-2 個門的房間),智能體開發出了幾種湧現行為的階段。在具有更高隨機性的完整環境中(1-3 個躲藏者/搜尋者、3-9 個方塊、2 個斜坡,以及隨機房間),智能體經歷了兩個額外的湧現策略階段。

技術架構與訓練

策略架構

智能體使用一種以實體為中心(entity-centric)且基於狀態的表示法,該表示法對於物體和其他智能體具有置換不變性(permutation invariant)。該架構採用了遮罩殘差自注意力機制(masked residual self-attention block)——類似於 Transformer 中使用的機制——其中注意力是應用在物體而非時間上。視線範圍外的物體會被遮罩掉。

訓練方法論

  • 演算法: 策略是使用自我博弈(self-play)和近端策略優化(Proximal Policy Optimization, PPO)進行訓練的。
  • 價值函數: 在優化過程中,智能體可以在其價值函數中使用關於被遮蔽物體和其他智能體的特權資訊。
  • 規模: 大規模訓練對於湧現至關重要。OpenAI 發現,當 batch size 為 8k 和 16k 時,無法達到「斜坡防禦」階段(第 4 階段),而較大的 batch size 顯量顯著加速了時鐘收斂時間。

多智能體競爭 vs. 內在動機

OpenAI 將多智能體競爭與內在動機(基於計數的探索,count-based exploration)進行了比較,後者是激勵智能體訪問不常被訪問的狀態。

  • 定性結果: 多智能體智能體開發出了人類可解釋的行為,例如建造避難所。相比之下,使用內在動機訓練的智能體,其移動物體的方式看起來像是無目的的。
  • 可擴展性: 隨著狀態空間複雜度增加,內在動機方法顯示出與物體較少的有意義互動。這表明多智能體競爭是更具可擴展性的方法,能在無監督方式下產生與人類相關的技能。

透過轉移與微調進行評估

為了定量地衡量進展,除了追蹤獎勵或 ELO 分數,OpenAI 提出了以下一系列領域特定智能測試:

  1. 物體計數: 透過預測物體移動來測試記憶力與物體恆常性。
  2. 鎖定與返回: 測試對位置的長期記憶。
  3. 序列鎖定: 測試在未觀察順序下記憶箱子狀態的能力。
  4. 藍圖構建: 測試將箱子移動到特定目標位置的能力。
  5. 避難所構建: 測試在圓柱體周圍建造避難所的能力。

雖然躲貓貓智能體在許多任務上的表現優於基準模型,但它們並沒有大幅改善收斂時間。OpenAI 將此歸因於糾纏的技能表示法(entangled skill representations)使其難以進行微調,這表明需要更多樣化的環境來產生具備泛化能力的技能表示法。

非預期行為與漏洞利用

在高度逼真的物理模擬器中訓練智能體,通常會導致發現非預期環境或物理漏洞的利用:

  • 箱子衝浪: 智能體抓取箱子並站在其上方以「衝浪」到躲藏者的位置。
  • 無盡奔跑: 躲藏者偶爾會學會拿著箱子並無盡地奔跑以避免搜尋者。
  • 斜坡利用: 躲藏者可能會濫用接觸物理機制來將斜坡從遊戲區域移除,而搜尋者可能會透過以特定角度撞擊牆壁並利用斜坡向上彈起。

Sources