OpenAI 研究請求 2.0

OpenAI 已發布 Research Requests 2.0,這是一套源自其內部研究的七個未解決問題。此計畫旨在透過提供具體且高影響力的技術挑戰(在強化學習(RL)、生成模型和自動推理領域)來吸引更廣泛的研究社群參與。

強化學習挑戰

OpenAI 辨識出數個專注於提升強化學習代理穩定性與效率的挑戰。

多人遊戲環境(Slitherin’)

研究人員的任務是將經典貪食蛇遊戲的多人版作為 Gym 環境來實作。目標是利用自我對戰和 RL 演算法開發代理來解決此環境。主要技術挑戰包括:

  • 環境設計:創建一個大型場地,其中多條蛇會隨著吃水果而成長,並在撞到牆壁、其他蛇或自身時死亡。
  • 自我對戰不穩定性:透過針對過去策略分布進行訓練的實驗,克服自我對戰常見的不穩定性(類似 GAN 不穩定性)。
  • 行為分析:判斷代理是否學會複雜策略,例如攻擊、陷阱或結夥對付競爭者。

分布式強化學習中的參數平均

此請求聚焦於分布式 RL 演算法的樣本複雜度與通訊開銷。OpenAI 建議探索參數平均方案,以透過獨立更新工作節點並不頻繁平均參數來降低通訊頻寬。潛在好處包括:

  • 探索能力提升:參數不同的代理可能表現出更好的探索行為。
  • 樣本複雜度:研究不同的平均方案(包括如 EASGD 之類的演算法)如何影響整體學習效率。

生成模型與架構

OpenAI 提議研究基於 Transformer 的模型在效率與可遷移性方面的表現。

透過生成模型進行遷移學習

此挑戰探索在多樣化任務集上進行預訓練是否能提升新任務的表現。所提出的方法包括:

  • 訓練 11 個 Atari 遊戲的策略。
  • 將生成模型(例如 Transformer)擬合到這些遊戲中 10 個的軌跡。
  • 在第 11 個遊戲上微調模型,以量化預訓練的好處。
  • 分析模型大小以及第 11 個遊戲可用資料量如何影響遷移學習的好處。

具線性注意力的 Transformer

OpenAI 尋求一種方法,將 Transformer 中的 softmax 注意力機制替換為線性注意力。這樣可以將 Transformer 轉換為具有快速權重的 RNN,使得在較大上下文中進行 RL rollout 變得可行。具體目標是使用線性注意力 Transformer 在語言建模任務上達成與原始模型相同的每字元/字位元數,而不顯著增加總參數數量。OpenAI 指出這可能需要更高維度的 key/value 向量。

自動推理

OpenAI 挑戰社群開發奧林匹亞不等式問題的自動解決方案。這類問題的特點是表達簡單,但解決時需要巧妙的操作。目標是建構這些問題的資料集,並創建一個能夠解決大部分問題的程式,潛在地使用學習到的策略來降低尋找解決方案時的分支因子。

入門問題(熱身)

為協助研究者上手,OpenAI 提供了兩個已解決的入門問題:

  • LSTM XOR 問題:訓練 LSTM 來判斷二進位序列的奇偶性,測試固定長度與變長二進位字串在效能上的差異。
  • Snake Gym 環境:將基本的貪食蛇遊戲實作為 Gym 環境,並使用強化學習演算法來解決它。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch