OpenAI 一次模仿學習

OpenAI 已經開發出一個用於一次模仿學習的元學習框架,使機器人能夠從單次示範中學習一項任務,並立即推廣到該任務的新實例。此方法消除了對廣泛特徵工程或大規模樣本大小的需求,這些通常是傳統模仿學習所必需的。

元學習框架以實現泛化

一次模仿學習利用元學習方法來學習如何學習。與其孤立地解決特定任務,不如在大量任務集上訓練模型,每個任務都有多個實例。例如,一項任務可能涉及將積木堆疊成單一塔或將積木排列成兩積木塔。該任務的每個實例涉及不同的初始狀態和不同的積木集合。

訓練過程

在訓練期間,算法會被呈現示範對。神經網路被訓練以接受兩個輸入:一個示範和機器人的當前狀態。在此過程中,模型嘗試匹配來自配對中第二個示範的狀態與動作序列。目標是輸出一個動作,使得產生的狀態與動作序列盡可能接近第二個示範。

測試時表現

在測試時,模型會被呈現一個新任務單一實例的示範。然後預期神經網路能在該新任務的新且未見過的實例上執行該任務。此能力使機器人能夠在運行時提供的單獨示範基礎上執行其從未見過的新任務。

技術實作與可擴展性

該系統採用軟注意力機制,使模型能夠泛化到訓練資料中未出現的條件和任務。這使模型能夠適用於更廣泛的任務和設置。

OpenAI 研究人員預期,透過在更多樣化的任務和設置上訓練模型,模型最終將成為一個通用系統,能夠將任何示範轉化為強大的政策,從而完成各種多樣化的任務。

Sources