FilippoAiraldi/mpc-reinforcement-learning
Reinforcement Learning with Model Predictive Control
解決的問題
此套件提供一個框架,用於訓練基於模型的強化學習(RL)代理,其中模型預測控制(MPC)作為函數近似。它結合了MPC預測未來環境行為並計算最佳動作的能力,與RL在未知且複雜環境中適應的彈性,使代理能在基礎動態或成本未完全已知的系統中學習最佳控制策略。
工作原理
該框架使用一個參數化的MPC控制器,其目標函數、預測模型和約束條件皆可調節。該控制器既作為策略提供者(產生動作),也作為狀態與狀態-動作價值函數的函數近似器。隨後,使用Q學習或決定性策略梯度(DPG)等RL演算法來調整這些MPC參數,以提升效能。該套件利用 csnlp 計算MPC控制器相對於其參數的敏感度,這對於計算RL更新至關重要。
適用對象
從事最佳控制與強化學習的研究人員與工程師,特別是處理物理或模擬系統中連續狀態與動作空間者(例如:線性時不變系統)。
特色
- 混合方法:將MPC與RL整合為單一的資料驅動控制技術。
- 多種RL演算法:支援基於梯度的方法,如線上策略與離線策略Q學習、DPG,以及無梯度方法如貝葉斯優化。
- 整合性:相容
gymnasium環境,並利用csnlp進行敏感度分析。 - 參數化控制:透過RL學習代理,可調節預測模型、目標函數與約束條件。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案