OpenAI 線上規劃 離線學習 (POLO) 框架

OpenAI 已推出 Plan Online Learn Offline (POLO) 框架,這是一種讓具備內部模型的代理人在環境中持續行動與學習的方法。此框架旨在透過在本地軌跡優化與全域價值函數學習之間建立協同關係,提升複雜控制任務的學習效率與探索穩定性。

協同式模型基礎控制與價值學習

POLO 框架的運作原則是,本地模型基礎控制與全域價值函數學習可以相互增強,以克服各自的限制。

本地軌跡優化

本地軌跡優化使代理人能夠應對全域價值函數的近似誤差。透過本地規劃,代理人可以穩定並加速價值函數的學習過程。

全域價值函數學習

近似的價值函數提供全域視角,協助代理人縮短其規劃視野。視野的縮短使代理人能夠發現並實施超越簡單本地解決方案的策略。

時間協調的探索

在複雜環境中高效學習需要代理人有效地探索其狀態空間。POLO 利用軌跡優化來執行時間協調的探索。

此探索策略透過將軌跡優化與價值函數近似的不確定性估計相結合來實現。這種協調方法對於快速且穩定地學習價值函數至關重要。

複雜控制任務的效能

POLO 框架使得以高樣本效率解決複雜的模擬控制任務成為可能。具體而言,該框架被應用於:

  • Humanoid Locomotion: 使模擬類人機能行走。
  • Dexterous In-Hand Manipulation: 在模擬手中管理複雜的物體操作。

根據 OpenAI 的說法,這些任務相當於在現實世界中只需幾分鐘的經驗即可解決。

Sources