透過學習深度逆動力模型從模擬轉移到真實世界 – OpenAI 2016
TL;DR
OpenAI 提出了一種技術,用於將在模擬中學習的控制策略轉移到真實世界的機器人。在每個時間步,該方法使用模擬策略來預測下一個狀態,然後查詢已學習的深度逆動力模型,以選擇能產生該狀態的真實世界動作,從而繞過對精確動力參數的需求。
Method Overview
該方法首先運行在模擬中訓練的控制策略。與其在真實機器人上執行策略的原始控制訊號,不如計算在應用該訊號後模擬所預期的狀態。經過真實世界數據訓練的深度逆動力模型接著決定哪個真實世界動作最有可能達到該預期的下一個狀態。此逆模型取代了導致模擬‑真實世界差距的缺失或不準確的動力項(例如摩擦、接觸、質量、幾何)。
Data Collection for the Inverse Dynamics Model
為了訓練深度逆動力模型,作者提出了一種增量資料收集程序。機器人執行探索性動作,記錄由此產生的狀態轉移,並使用這些 (動作, 結果狀態) 配對來監督模型。隨著收集的資料增加,模型的預測變得更準確,使得轉移方法能夠隨時間改進其動作選擇。
Experimental Comparison
作者將其方法與幾個專門處理模擬‑真實世界差異的基線進行評估,包括輸出誤差控制和高斯動力適應。實驗顯示,深度逆動力方法相較於這些基線表現更佳,表明從真實數據學習逆模型能夠有效縮小差距,而無需顯式的系統辨識。
Implications
透過將策略學習與精確的動力建模分離,該技術使得在硬體部署之前,在模擬中開發複雜機器人行為變得更安全且更實用。同時,它也凸顯了一種通用策略:從真實互動中學習逆動力模型,並利用它將模擬計畫轉譯為真實世界動作,這一原則可應用於各種機器人平台與學習演算法。