OpenAI 競爭自我對弈研究

OpenAI 已經展示競爭自我對弈使得模擬的 AI 代理能夠發現複雜的物理技能——例如擒抱、下蹲、假動作、踢球、接球和潛水——而無需將這些行為明確編程到環境中。此方法確保訓練環境保持在適合 AI 改進的最佳難度水平,表明自我對弈將成為未來強大 AI 系統的基礎組成部分。

透過簡單目標產生的行為

競爭壓力與簡單的獎勵結構相結合,使代理能夠自我提升表現。在涉及模擬 3D 機器人進行基本遊戲的實驗中,OpenAI 使用了近端策略優化 (PPO) 來為每個代理獨立訓練神經網路策略。

訓練方法論

代理透過兩階段獎勵系統進行訓練:

  1. 密集獎勵: 初期,代理會因基本探索行為(如站立和前進)獲得獎勵。
  2. 競爭獎勵: 這些密集獎勵會逐步退火至零,將代理的焦點轉向主要目標——贏或輸(例如將對手推出相撲圈或將球踢進網中)。

案例研究:相撲摔跤

在相撲摔跤任務中,OpenAI 利用了基於先前工作的密集探索獎勵來訓練類人機器人行走,移除了速度項並加上了從環中心的負 L2 距離。一旦代理探索完環境,該獎勵會被退火至零,迫使代理優化競爭獎勵:將對手推出相撲圈。

遷移學習與泛化

透過競爭自我對弈訓練的代理表現出遷移學習,意謂著他們可以將在一個環境中學到的技能應用於新的、未見過的環境。

在一項特定測試中,一個訓練用於相撲摔跤的代理被放置在受到「風」力干擾的環境中。儘管在訓練期間從未遇過風,相撲代理仍能保持直立。相反地,使用經典強化學習訓練行走的代理在暴露於相同力量時會立即倒下。

減輕自我對弈中的過擬合

OpenAI 識別出過擬合的風險,即代理共同學習專門針對單一對手的策略,而不是發展一般策略。為防止代理學習針對特定對手的狹窄對策,OpenAI 採取了以下策略:

  • 多樣化對手集合: 代理同時面對多個不同的對手。
  • 策略歷史: 代理面對訓練過程早期階段的策略。

透過針對多樣化策略集合進行訓練,代理被迫發展出對各種對手仍然有效的一般策略。

可用性

OpenAI 已透過 GitHub 將此研究中使用的 MuJoCo 環境和訓練好的策略公開發布,以方便進一步的自我對弈系統實驗。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch