OpenAI 非對稱 Actor-Critic 用於基於圖像的機器人學習

OpenAI 已開發出一種用於基於圖像的機器人學習的非對稱 Actor-Critic 框架,使機器人能夠在模擬中學習複雜任務並將這些技能遷移到真實世界,而不需要任何真實世界的訓練數據。此方法利用物理模擬器的完整狀態可觀測性來訓練更準確的評論家(critic),而行動者(策略)則被限制為與其在真實世界中將遇到的相同部分觀測(RGBD 影像)。

非對稱 Actor-Critic 架構

非對稱 Actor-Critic 方法的核心創新是在訓練過程中解耦 actor 和 critic 可用的資訊。在傳統的 actor-critic RL 中,兩個組件通常共享相同的觀測空間。在這種非對稱方法中:

  • 評論家: 使用物理模擬器提供的完整狀態可觀測性進行訓練。這使評論家能夠精確了解環境的真實狀態,模擬一種「特權」資訊流。
  • 行動者(策略): 僅接收渲染的 RGBD 影像作為輸入。這確保行動者學習基於深度和顏色的相同視覺觀測來操作,這些觀測正是其在真實世界部署時將使用的。

透過向評論家提供完整狀態資訊,該算法能夠更有效地引導行動者的學習過程,提升模擬中學習過程的整體性能和穩定性。

模擬到真實世界遷移

為了彌合模擬環境與實體世界之間的差距,OpenAI 將非對稱 Actor-Critic 方法與域隨機化結合。域隨機化涉及在模擬中改變環境的物理屬性和視覺外觀,以確保策略對真實世界與模擬之間的視覺和物理差異具有穩健性。

OpenAI 研究人員展示了將僅在模擬中訓練的策略成功遷移到實體機器人。該機器人完成了以下幾項任務:

  • 抓取一個方塊
  • 推動一個方塊
  • 將方塊推到特定位置
  • 移動一個方塊

這些任務是在未使用任何真實世界訓練數據的情況下完成的,這是降低在實體硬體上訓練 RL 代理所帶來的成本與風險的重要里程碑。

對機器人學習的影響

此研究表明,利用模擬器的完整狀態可觀測性進行非對稱 Actor-Critic 訓練,能夠實現更高效且穩健的機器人學習。透過將行動者的輸入空間與觀測序列分離,行動者可以學習根據高保真評論家的手把手指導將視覺輸入映射到動作,同時在真實世界部署中保持相容,因為在該情境下完整狀態資訊不可用。

Sources

相關