Ronchy2000/Multi-agent-RL

Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.

解決的問題

本儲存庫提供一個結構化的學習路徑與強化學習(RL)及多智能體強化學習(MARL)的實作集合。特別針對從基礎單智能體RL演算法,過渡到複雜多智能體情境(例如連續動作空間中的追捕-逃避遊戲(捕食者-獵物))所面臨的挑戰。

工作原理

專案以模組化逐步推進的方式組織:

  • 基礎RL:價值迭代、策略迭代、蒙特卡洛、時序差分、DQN、REINFORCE的實作。
  • 進階單智能體RL:Actor-Critic與DDPG的實作。
  • 多智能體RL:利用PettingZoo MPE框架,將單智能體演算法擴展至多智能體環境,包含MADDPG、MATD3(使用雙Q網路與延遲更新以減少過度估計)、MAPPO/HAPPO(支援隨機策略與觀測維度不同的異質智能體)的實作。

適用對象

  • 研究與學習強化學習與多智能體系統的研究人員與學生。
  • 尋找連續動作空間下MARL演算法具體PyTorch實作的開發者。
  • 對追捕-逃避遊戲模擬與群體智慧感興趣的使用者。

特色

  • 全面的學習路徑:涵蓋從基礎數學基礎到高階MARL的完整旅程。
  • 多樣化的MARL演算法:包含MADDPG、MATD3與HAPPO/MAPPO。
  • 異質支援:HAPPO實作支援具備不同能力與觀測維度的智能體。
  • 專為追捕-逃避優化:特別針對使用PettingZoo的捕食者-獵物任務進行調校。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案