OpenAI 機器人能學習:來自模擬的一次模仿學習

OpenAI 已創建一個機器人系統,能夠在看到任務執行一次後學習新任務。該系統完全在模擬中訓練,然後部署在實體機器人上,消除了對真實世界圖像訓練的需求。

一次模仿學習與 VR 整合

OpenAI 的新演算法——一次模仿學習——允許人類透過在虛擬實境(VR)中執行任務來向機器人傳遞任務。在模擬器中進行一次示範後,機器人能夠從實體世界中的任意起始配置解決相同的任務。

系統架構:視覺與模仿網路

該系統由兩個負責感知與任務執行的獨特神經網路驅動:

視覺網路

視覺網路將機器人相機的影像轉換為物體位置的狀態表示。為確保系統能夠泛化到實體世界,該網路透過域隨機化進行訓練——讓其接觸數十萬張光線、紋理和物體擾動各異的模擬影像。視覺系統從未在真實圖像上進行訓練。

模仿網路

模仿網路從示範中推斷任務的意圖,並將該意圖推廣到新的情境。它透過數十項任務、每項任務數千次示範進行訓練,使用從不同起始狀態執行相同任務的軌跡對。透過監督學習,該網路預測示範者在特定觀測下所採取的動作,學會優先考慮任務的相關部分,而非物體的特定起始位置。

應用於積木堆疊

OpenAI 透過一項積木堆疊任務展示了系統的能力,該任務中機器人會創建顏色編碼的積木堆疊。

使用腳本政策進行訓練

由於積木堆疊是一項足夠簡單的任務,OpenAI 在模擬中使用腳本政策來為模仿網路生成訓練資料。儘管是在腳本資料上訓練的,模仿網路在測試時仍能成功解析由人類產生的示範,儘管它之前從未遇過「雜亂」的人類資料。

透過軟注意力進行擴展與泛化

模仿網路在示範軌跡與積木位置狀態向量上使用軟注意力。此架構使系統能夠:

  • 處理長度可變的示範。
  • 模仿長度超過訓練期間所見任何軌跡。
  • 將積木堆疊成包含比訓練集中任何示範更多積木的配置。

透過噪聲注入提升穩健性

為確保政策具有穩健性,OpenAI 在訓練期間向腳本政策的輸出注入適量的噪聲。這迫使腳本政策在發生錯誤時展現恢復行為,進而教導模仿網路如何處理來自不完美政策的干擾。若沒有此噪聲注入,模仿網路通常會無法完成堆疊任務。

Sources