OpenAI 元學習摔跤

OpenAI 已開發出一種用於模擬機器人摔跤的元學習代理,該代理能夠快速調整其策略以擊敗更強的對手並彌補身體故障。此能力使代理能夠根據與新環境或對手的少量互動,即時優化其表現。

多代理適應的修改版 MAML

OpenAI 將模型不可知元學習(MAML)算法擴展為針對環境對進行優化,而非單一環境。儘管標準 MAML 會初始化策略,使其能夠以最少的參數更新快速適應新任務,但此修改版本使代理能夠適應先前未見過的環境,前提是它們與先前訓練資料的偏差不過於劇烈。

在執行期間,代理會對與新環境互動的前幾個情節中收集的獎勵執行梯度上升步驟。此過程使代理能夠即時調整其策略參數,以更好地應對特定對手。

實驗設置與結果

為了測試持續適應,OpenAI 使用了形態各異的三種模擬代理:

  • Ant (4腳)
  • Bug (6腳)
  • Spider (8腳)

這些代理在多回合遊戲中競賽,他們會與同一對手進行數場比賽。元學習代理會在回合間調整其策略參數,以應對對手的具體策略。OpenAI 發現,能夠調整戰術的代理相比固定策略的代理,在競賽中顯著更成功。

身體故障的適應

除了適應外部對手之外,元學習方法還使代理能夠處理內部變化。OpenAI 展示了代理能夠適應身體故障,例如隨時間推移其自身某些肢體功能的喪失。這表明元學習可用於開發同時能夠應對外部環境變化以及自身內部狀態或身體變化的代理。

可用性與研究背景

此工作是 OpenAI 大規模多代理系統研究的一部份。為了促進進一步實驗,OpenAI 已透過 GitHub 發佈了該研究中使用的 MuJoCo 環境與訓練好的策略。

Sources

相關