OpenAI Procgen 與 MineRL 競賽

OpenAI 與 AIcrowd、卡內基美隆大學(Carnegie Mellon University)以及 DeepMind 合作,共同為 NeurIPS 2020 舉辦兩項競賽。這些競賽利用 Procgen Benchmark 和 MineRL,挑戰研究社群提升強化學習(RL)中的樣本效率與泛化能力。

Procgen 競賽:提升泛化能力與樣本效率

Procgen 競賽旨在透過在多樣化的環境集中使用固定數量的環境互動,來最大化代理人(agent)的性能。這種方法旨在測試代理人對未知情況的泛化能力,並提高其樣本效率。

評估指標與環境

代理人將在 16 個公開發佈的 Procgen Benchmark 環境以及專為本次競賽創建的四個秘密測試環境中接受評估。透過整合這些多樣化設置下的性能,主辦單位提供了高品質的指標來判斷底層演算法。

易用性設計

由於 Procgen 環境是程序化生成的,因此它們本質上要求代理人必須泛化到新情況。這些環境設計得快速且易於使用,讓計算資源有限的參與者也能重現基準結果並快速迭代新方法。

MineRL 競賽:利用人類示範

MineRL 2020 競賽專注於開發能夠有效利用人類示範來解決複雜、層級化且稀疏環境的演算法。這是為了應對許多尖端 RL 系統(例如 AlphaStar 和 OpenAI Five)需要呈指數級增加的計算量與模擬器樣本數,導致它們難以應用於樣本成本高昂的現實世界問題。

技術限制與目標

參與者必須開發能夠從原始像素中在 Minecraft 中獲得鑽石的系統。競賽施加了嚴格的限制,以確保開發出真正具備樣本效率的演算法:

  • 樣本限制: 僅限從 MineRL 模擬器中獲取 8,000,000 個樣本。
  • 計算限制: 在單台 GPU 機器上進行 4 天的訓練。
  • 數據源: 參與者將獲得 MineRL-v0 數據集,其中包含超過 6,000 萬幀的人類示範。

與標準 RL 的比較

繼承了 MineRL 2019 競賽(當時頂尖代理人獲得了鐵鎬)之後,2020 年的挑戰進一步推動了技術前沿。雖然標準 RL 系統通常需要在大型多 GPU 系統上進行數億次的環境互動才能達到類似目標,但 MineRL 競賽的限制迫使研究者必須依賴專家軌跡(expert trajectories)來最小化模擬器互動。

驗證與防過擬合措施

為了防止人工設計特徵或對特定領域進行過擬合,MineRL 競賽主辦單位將使用相同的嚴格硬體、計算與模擬器互動限制,從頭開始訓練頂尖團隊的決賽模型。

Sources