OpenAI 基于时间段模型的预测与控制
OpenAI 提出了一种方法,利用在状态和动作的时间段上运行的深度生成模型来学习复杂非线性系统的动态。与仅在离散时间步上运行的传统动态模型相比,这种方法在随机系统中能够实现更稳定、更准确的长时域预测。
时间段建模用于系统动态
该方法不是预测序列中的下一个单一状态,而是学习在三个主要因素条件下的未来状态轨迹的分布:过去的状态、过去的动作以及计划的未来动作轨迹。此外,模型还引入了动作轨迹的先验潜在变量,以更好地理解运动和控制的底层模式。
通过将焦点从离散时间步转移到时间段,该模型能够更有效地处理真实世界物理系统的复杂性,包括:
- 随机性:表达预测不确定性的能力。
- 物理干扰:建模碰撞的影响。
- 噪声:考虑传感噪声和动作延迟。
技术架构
该系统构建在两种主要的深度学习架构之上:
- 卷积自回归模型:用于建模状态和动作的序列。
- 变分自编码器(VAEs):用于构建生成过程和先验潜在变量。
在控制与优化中的应用
所学习的动态模型及其关联的动作先验是完全可微的,这使得它们可以用于两项高层次的优化任务:
轨迹优化
该模型支持端到端的完全可微轨迹优化,使得系统能够计算达到目标状态的最优状态和动作路径。
基于模型的策略优化
该架构用于基于模型的策略优化,以评估和提高学习过程的样本效率,从而减少代理学习有效控制策略所需的数据量。
由 Nikhil Mishra、Pieter Abbeel 和 Igor Mordatch 撰写的这项研究表明,采用轨迹的生成建模方法可以应对复杂非线性环境中长期预测与控制的挑战。