OpenAI 计划在线学习离线(POLO)框架
OpenAI 推出了计划在线学习离线(POLO)框架,这是一种针对拥有内部模型的代理人在环境中持续行动和学习的方法。该框架旨在通过在本地轨迹优化与全局价值函数学习之间建立协同关系,提高复杂控制任务中的学习效率和探索稳定性。
协同的基于模型的控制与价值学习
POLO 框架基于这样一个原理:本地基于模型的控制和全局价值函数学习可以相互强化,以克服各自的局限性。
本地轨迹优化
本地轨迹优化使代理人能够应对全局价值函数的近似误差。通过本地规划,代理人可以稳定并加速价值函数的学习过程。
全局价值函数学习
近似价值函数提供了全局视角,帮助代理人缩短其规划视野。视野的缩短使代理人能够发现并实现超越简单本地解的策略。
时间协调的探索
在复杂环境中实现高效学习需要代理人有效地探索其状态空间。POLO 利用轨迹优化进行时间协调的探索。
该探索策略通过将轨迹优化与价值函数近似的不确定性估计相结合来实现。这种协同方法对于价值函数的快速且稳定的学习至关重要。
在复杂控制任务中的表现
POLO 框架能够以高样本效率解决复杂的模拟控制任务。具体而言,框架被应用于:
- 类人机器人行走:使模拟的类人机器人能够行走。
- 灵巧的手内操作:在模拟手中管理复杂的物体操作。
据 OpenAI 称,这些任务在相当于现实世界中几分钟的经验时间内就已解决。