OpenAI 第三人稱模仿學習
OpenAI 已開發出一種無監督的第三人稱模仿學習方法,使得 AI 代理能夠透過觀察不同視角的示範來達成目標。此方法移除了對第一人稱示範的需求,其中代理必須被提供它應該執行的精確狀態與動作序列,從而簡化了資料收集過程。
無監督第三人稱模仿學習
第三人稱模仿學習的核心目標是在觀察老師從不同視角達成同樣目標之後,訓練代理在簡單環境中達成該目標。該過程被定義為「無監督」,因為代理沒有被提供老師狀態與其自身狀態之間的直接對應。
此方法解決了傳統強化學習(RL)的一項主要限制。雖然 RL 使代理能夠達成複雜目標,但指定一個準確的獎勵函數往往很困難。傳統模仿學習透過使用第一人稱示範來解決此問題,但收集此類資料具有挑戰性。透過模仿人類學習方式——觀察他人並推斷任務——此方法使代理能夠從外部觀察中學習。
技術方法:領域無關特徵
此方法背後的主要技術見解是應用領域混淆來創建領域無關特徵。這些特徵在訓練過程中至關重要,因為它們使代理能夠彌合老師視角與其自身視角之間的差距,確保所學行為無論示範來自何種視角都適用。
實驗驗證
OpenAI 在三個特定領域驗證了無監督第三人稱模仿學習方法,以展示其效能:
- Pointmass 領域: 測試代理在簡單點基礎環境中導航的能力。
- Reacher 領域: 測試代理到達目標位置的能力。
- 倒立擺: 測試代理使擺錘在直立位置保持平衡的能力。
Sources
- OriginalThird-person imitation learning