Farama-Foundation/MPE2
A set of communication oriented environments
解決的問題
MPE2 提供一組通訊導向的模擬環境,用於訓練與測試多智能體強化學習(MARL)演算法。它解決了在合作與對抗情境中,智能體必須學習互動、通訊與協調以完成任務的標準化、輕量級環境需求。
工作原理
本專案實作一系列「粒子」環境,其中智能體以圓形表示,可移動、觀測其他智能體,並與靜態地標互動。支援離散(預設)與連續動作空間,讓智能體能控制其在基本方向上的移動,或透過通訊通道廣播訊息。系統會追蹤觀測值(位置、速度與接收訊息)以及根據智能體達成目標(如推動物體或標記其他智能體)的成功程度所獲得的獎勵。
適用對象
專為從事多智能體人工智慧的研究人員與開發者設計,特別是專注於強化學習中出現式通訊、協調,以及競爭/合作博弈論的使用者。
主要特色
- 多樣化的互動模型:包含合作環境(如 Simple Spread、Simple Formation)與對抗環境(如 Simple Tag、Simple Push)。
- 彈性動作空間:支援移動與通訊的離散與連續控制。
- 通訊通道:內建機制,讓智能體能廣播與接收訊息以協調行動。
- 提升的穩定性:基於 OpenAI 原始 MPE,但修正了獎勵一致性與離散動作空間預設值的問題。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案