Farama-Foundation/MO-Gymnasium

Multi-objective Gymnasium environments for reinforcement learning

解決的問題

提供一種標準化的方法,用於開發與比較多目標強化學習(MORL)演算法。過去,研究人員需要一個一致的 API,以及能同時處理多個獎勵信號(而非單一標量值)的基準環境。

工作原理

MO-Gymnasium 延伸了標準的 Gymnasium API。雖然它維持與環境互動的基本結構,但修改了獎勵系統:step 函數不再回傳單一數值,而是回傳作為 numpy 陣列的向量化獎勵。它也包含一個 LinearReward 包裝器,允許使用者透過權重選擇性地將多個獎勵轉換回單一標量值。

適用對象

需要可靠工具包,在標準環境中對演算法進行基準測試與驗證的多目標強化學習研究人員與開發者。

主要亮點

  • 多目標強化學習的標準化 API。
  • 包含來自 MORL 文獻的多種環境,以及 MuJoco 等經典環境的多目標版本。
  • 嚴格的環境版本控制,確保研究可重現性。
  • 與 Gymnasium API 模式相容。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案