FilippoAiraldi/mpc-reinforcement-learning

Reinforcement Learning with Model Predictive Control

解決的問題

此套件提供一個框架,用於訓練基於模型的強化學習(RL)代理,其中模型預測控制(MPC)作為函數近似。它結合了MPC預測未來環境行為並計算最佳動作的能力,與RL在未知且複雜環境中適應的彈性,使代理能在基礎動態或成本未完全已知的系統中學習最佳控制策略。

工作原理

該框架使用一個參數化的MPC控制器,其目標函數、預測模型和約束條件皆可調節。該控制器既作為策略提供者(產生動作),也作為狀態與狀態-動作價值函數的函數近似器。隨後,使用Q學習或決定性策略梯度(DPG)等RL演算法來調整這些MPC參數,以提升效能。該套件利用 csnlp 計算MPC控制器相對於其參數的敏感度,這對於計算RL更新至關重要。

適用對象

從事最佳控制與強化學習的研究人員與工程師,特別是處理物理或模擬系統中連續狀態與動作空間者(例如:線性時不變系統)。

特色

  • 混合方法:將MPC與RL整合為單一的資料驅動控制技術。
  • 多種RL演算法:支援基於梯度的方法,如線上策略與離線策略Q學習、DPG,以及無梯度方法如貝葉斯優化。
  • 整合性:相容 gymnasium 環境,並利用 csnlp 進行敏感度分析。
  • 參數化控制:透過RL學習代理,可調節預測模型、目標函數與約束條件。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案