Ronchy2000/Multi-agent-RL
Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.
解決的問題
本儲存庫提供一個結構化的學習路徑與強化學習(RL)及多智能體強化學習(MARL)的實作集合。特別針對從基礎單智能體RL演算法,過渡到複雜多智能體情境(例如連續動作空間中的追捕-逃避遊戲(捕食者-獵物))所面臨的挑戰。
工作原理
專案以模組化逐步推進的方式組織:
- 基礎RL:價值迭代、策略迭代、蒙特卡洛、時序差分、DQN、REINFORCE的實作。
- 進階單智能體RL:Actor-Critic與DDPG的實作。
- 多智能體RL:利用PettingZoo MPE框架,將單智能體演算法擴展至多智能體環境,包含MADDPG、MATD3(使用雙Q網路與延遲更新以減少過度估計)、MAPPO/HAPPO(支援隨機策略與觀測維度不同的異質智能體)的實作。
適用對象
- 研究與學習強化學習與多智能體系統的研究人員與學生。
- 尋找連續動作空間下MARL演算法具體PyTorch實作的開發者。
- 對追捕-逃避遊戲模擬與群體智慧感興趣的使用者。
特色
- 全面的學習路徑:涵蓋從基礎數學基礎到高階MARL的完整旅程。
- 多樣化的MARL演算法:包含MADDPG、MATD3與HAPPO/MAPPO。
- 異質支援:HAPPO實作支援具備不同能力與觀測維度的智能體。
- 專為追捕-逃避優化:特別針對使用PettingZoo的捕食者-獵物任務進行調校。
相關
- 專案
- 專案
- 專案
- 專案
- 專案