OpenAI 從模擬中泛化
OpenAI 已開發出機器人技術,使得完全在模擬中訓練的機器人控制器能夠部署到實體機器人上,並對未規劃的環境變化做出反應。這種轉變使得可以創建閉環系統,適應真實世界的動態,而無需模擬器完美匹配實體世界。
動態隨機化以適應環境
動態隨機化透過在廣泛的模擬條件下訓練機器人,使其能適應未知的真實世界動態。與其嘗試創建現實的完美複製品,OpenAI 在訓練期間隨機化九十五種不同的屬性,包括:
- 機器人每個連桿的質量。
- 目標物體的摩擦力和阻尼。
- 支撐物體的桌子高度。
- 動作之間的延遲。
- 觀測噪聲。
為實現此目標,OpenAI 使用了基於 LSTM 的策略來訓練機器人推冰球。儘管標準前饋網路在此任務上失敗,LSTM 成功了,因為它們可以利用過去的觀測來分析世界動態並即時調整行為。
端到端視覺到行動學習
OpenAI 成功地在模擬中使用強化學習 (RL) 端到端訓練機器人,將視覺直接映射到行動。該系統無需特殊感測器,並根據視覺回饋進行適應。
使用 Hindsight Experience Replay (HER) 克除稀疏獎勵
傳統的 RL 演算法在撿取與放置任務上常常遇到困難,因為它們需要密集獎勵(詳細的逐步評分)才能運作。為了解決此問題,OpenAI 開發了 Hindsight Experience Replay (HER),使得代理能從二元獎勵中學習。HER 允許代理將失敗視為達到非預期狀態的成功嘗試,從而無論主要目標是否達成,都能從每一次互動中學習。
非對稱 Actor-Critic 架構
HER 的實作使用了具備非對稱資訊的 actor-critic 技術,以彌合模擬與現實之間的差距:
- 評論家: 可以存取模擬器的完整狀態,以提供完全準確的回饋並估算 Q 值(未來獎勵之和)。
- 演員: 只能存取 RGB 和深度資料,確保策略僅依賴實體世界可用的資料。
為確保視覺系統足夠穩健以適用於真實世界,OpenAI 也對視覺形狀應用了域隨機化。
計算成本與戰略展望
實施這些隨機化技術會增加訓練的計算開銷。動態隨機化會使訓練速度減慢 3 倍,而從圖像而非狀態學習則會慢 5–10 倍。
OpenAI 辨識出建構通用機器人的三條主要路徑:
- 在大量實體機器人艦隊上進行訓練。
- 提高模擬器的保真度以匹配真實世界。
- 隨機化模擬器以使模型能夠泛化到真實世界。
OpenAI 認為,他們越來越相信第三種方法——為泛化而進行的隨機化——將是解決方案中最關鍵的組成部分。
Sources
- OriginalGeneralizing from simulation
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch