OpenAI 變分選項發現演算法
OpenAI 推出了基於變分推理的選項發現新方法,具體提出了透過強化學習的變分自編碼選項學習(VALOR)演算法以及一種課程式學習策略,以提升多樣行為模式的發現。
透過強化學習的變分自編碼選項學習(VALOR)
VALOR 是一種強化學習方法,源自變分選項發現與變分自編碼器(VAE)之間的緊密關聯。在此框架中,代理人的策略充當編碼器,將來自噪聲分佈的情境映射為特定軌跡。相對地,解碼器則設計用來從代理人生成的完整軌跡中恢復原始情境。
選項穩定性的課程式學習
為了解決變分選項發現中的訓練不穩定問題,OpenAI 提出了一種課程式學習方法。只有當代理人在當前情境集合上的表現足夠強健(由解碼器測量)時,才會增加其接觸的情境數量。
- 訓練穩定化:它使 VALOR 以及其他現有的變分選項發現方法的訓練過程更加穩定。
- 提升行為多樣性:它使單一代理人能學習到遠超過使用固定情境分佈時所能達到的行為模式。
研究範圍
除了主要的演算法貢獻外,研究亦探討一般變分選項發現方法的根本限制,並檢視已學習的選項如何應用於下游任務。