OpenAI 機器人能學習:來自模擬的一次模仿學習
OpenAI 已創建一個機器人系統,能夠在看到任務執行一次後學習新任務。該系統完全在模擬中訓練,然後部署在實體機器人上,消除了對真實世界圖像訓練的需求。
一次模仿學習與 VR 整合
OpenAI 的新演算法——一次模仿學習——允許人類透過在虛擬實境(VR)中執行任務來向機器人傳遞任務。在模擬器中進行一次示範後,機器人能夠從實體世界中的任意起始配置解決相同的任務。
系統架構:視覺與模仿網路
該系統由兩個負責感知與任務執行的獨特神經網路驅動:
視覺網路
視覺網路將機器人相機的影像轉換為物體位置的狀態表示。為確保系統能夠泛化到實體世界,該網路透過域隨機化進行訓練——讓其接觸數十萬張光線、紋理和物體擾動各異的模擬影像。視覺系統從未在真實圖像上進行訓練。
模仿網路
模仿網路從示範中推斷任務的意圖,並將該意圖推廣到新的情境。它透過數十項任務、每項任務數千次示範進行訓練,使用從不同起始狀態執行相同任務的軌跡對。透過監督學習,該網路預測示範者在特定觀測下所採取的動作,學會優先考慮任務的相關部分,而非物體的特定起始位置。
應用於積木堆疊
OpenAI 透過一項積木堆疊任務展示了系統的能力,該任務中機器人會創建顏色編碼的積木堆疊。
使用腳本政策進行訓練
由於積木堆疊是一項足夠簡單的任務,OpenAI 在模擬中使用腳本政策來為模仿網路生成訓練資料。儘管是在腳本資料上訓練的,模仿網路在測試時仍能成功解析由人類產生的示範,儘管它之前從未遇過「雜亂」的人類資料。
透過軟注意力進行擴展與泛化
模仿網路在示範軌跡與積木位置狀態向量上使用軟注意力。此架構使系統能夠:
- 處理長度可變的示範。
- 模仿長度超過訓練期間所見任何軌跡。
- 將積木堆疊成包含比訓練集中任何示範更多積木的配置。
透過噪聲注入提升穩健性
為確保政策具有穩健性,OpenAI 在訓練期間向腳本政策的輸出注入適量的噪聲。這迫使腳本政策在發生錯誤時展現恢復行為,進而教導模仿網路如何處理來自不完美政策的干擾。若沒有此噪聲注入,模仿網路通常會無法完成堆疊任務。
Sources
- OriginalRobots that learn