Farama-Foundation/Gymnasium
A standard API for single-agent reinforcement learning environments, with popular reference environments and related utilities (formerly Gym)
解決的問題
Gymnasium 為強化學習 (RL) 研究人員與開發人員提供了一種標準化的方式,用於構建、測試與比較不同的學習演算法。它消除了為每個新環境編寫自定義通訊程式碼的需求,確保演算法可以輕鬆移植到不同的模擬任務中。
工作原理
它定義了一個標準 Python API,作為學習演算法(代理)與環境之間的橋樑。透過將環境建模為具有 reset() 與 step() 等一致方法的 Python 類別,無論環境是簡單的文字遊戲還是複雜的物理模擬,它都能讓代理以統一的方式與世界互動、接收觀測與獎勵並執行動作。
適用對象
專為從事強化學習的開發人員與研究人員設計,範圍涵蓋從使用參考實作的初學者到為物理或遊戲環境構建複雜代理的專家。
亮點
- 多樣化的環境庫:包含廣泛的內建環境,如 Classic Control、Box2D 物理、用於除錯的 Toy Text、MuJoCo 多關節控制以及 Atari 2600 模擬。
- 嚴格的版本控制:為環境使用版本控制系統(例如 "-v0"),以確保影響學習結果的變更不會破壞可復現性。
- 可擴展的生態系統:支援大量符合 Gymnasium API 的第三方環境。
- 廣泛的相容性:支援 Linux 與 macOS 上的多個 Python 版本(3.10 至 3.14)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案