FilippoAiraldi/mpc-reinforcement-learning

Reinforcement Learning with Model Predictive Control

解决的问题

该库提供了一个框架,用于训练基于模型的强化学习(RL)智能体,其中模型预测控制(MPC)作为函数近似。它将MPC预测未来环境行为并计算最优动作的能力,与RL在未知和复杂环境中自适应的灵活性相结合,使智能体能够在底层动态或成本未完全已知的系统中学习最优控制策略。

工作原理

该框架使用一个参数化的MPC控制器,其目标函数、预测模型和约束条件均可调节。该控制器既作为策略提供者(生成动作),也作为状态和状态-动作价值函数的函数近似器。随后,使用Q学习或确定性策略梯度(DPG)等RL算法来调整这些MPC参数,以提升性能。该库利用 csnlp 计算MPC控制器相对于其参数的敏感性,这对于计算RL更新至关重要。

适用人群

从事最优控制和强化学习的研究人员和工程师,特别是处理物理或模拟系统中连续状态和动作空间的人员(例如:线性时不变系统)。

特点

  • 混合方法:将MPC与RL结合为一种单一的数据驱动控制技术。
  • 多种RL算法:支持基于梯度的方法,如在线策略和离线策略Q学习、DPG,以及无梯度方法如贝叶斯优化。
  • 集成性:兼容 gymnasium 环境,并利用 csnlp 进行敏感性分析。
  • 参数化控制:通过RL学习智能体,可调节预测模型、目标函数和约束条件。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目