FilippoAiraldi/mpc-reinforcement-learning

Reinforcement Learning with Model Predictive Control

何を解決するか

このライブラリは、モデル予測制御(MPC)を関数近似として用いることで、モデルベース強化学習(RL)エージェントを訓練するためのフレームワークを提供します。MPCが将来の環境行動を予測し最適な行動を計算する能力と、RLが未知で複雑な環境に適応する柔軟性を統合することで、基礎となるダイナミクスやコストが完全に分かっていないシステムにおいて、最適な制御方策を学習することが可能になります。

動作方法

このフレームワークは、目的関数、予測モデル、制約条件をパラメータ化したMPCコントローラーを使用します。このコントローラーは、行動を生成するポリシー提供者としてだけでなく、状態価値関数および状態-行動価値関数の関数近似器としても機能します。その後、Q学習や決定論的方策勾配(DPG)などのRLアルゴリズムを用いて、これらのMPCパラメータを最適化し、性能を向上させます。ライブラリは csnlp を活用してMPCコントローラーのパラメータに対する感度を計算し、RLの更新に不可欠な情報を得ています。

対象ユーザー

最適制御および強化学習に取り組む研究者やエンジニアで、特に物理的またはシミュレートされたシステム(例:線形時不変システム)における連続的な状態空間と行動空間を扱う方々に適しています。

特徴

  • ハイブリッドアプローチ:MPCとRLを統合した、データ駆動型の制御技術。
  • 複数のRLアルゴリズム:オンポリシーおよびオフポリシーのQ学習やDPGといった勾配ベースの手法、およびベイズ最適化などの勾配フリー手法をサポート。
  • 統合性gymnasium 環境と連携可能で、csnlp を用いて感度分析を実行。
  • パラメータ制御:RL学習エージェントを通じて予測モデル、目的関数、制約条件を調整可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト