vwxyzjn/cleanrl

High-quality single file implementation of Deep Reinforcement Learning algorithms with research-friendly features (PPO, DQN, C51, DDPG, TD3, SAC, PPG)

What it solves

CleanRL 解決了模組化深度強化學習(DRL)函式庫的複雜性與不透明性。許多 RL 函式庫使用大量抽象與子類別化,使研究人員難以了解演算法的精確實作細節,或在不必在深層檔案階層中穿梭的情況下原型化新功能。

How it works

CleanRL 並非採用模組化架構,而是提供高品質、單檔的 DRL 演算法實作。每個特定演算法變體的所有細節都包含在一個獨立的 Python 檔案中。此方式將可讀性與透明度置於程式碼重用之上,讓使用者能直接看到演算法的完整實作,而不必在多個模組之間切換。

Who it’s for

此函式庫設計給想要了解 RL 演算法內部運作或原型化標準模組化函式庫未支援之進階功能的研究人員與開發者。

Highlights

  • Single-file implementation: 每個演算法變體皆收錄於單一檔案,便於閱讀與除錯。
  • Benchmarked results: 包含 7+ 演算法在 34+ 遊戲上的基準結果。
  • Experiment tracking: 整合 Tensorboard 與 Weights and Biases 以進行日誌記錄與管理。
  • Cloud ready: 支援 Docker 與 AWS Batch,能將實驗規模擴展至上千次執行。
  • Broad algorithm support: 實作 PPO、DQN、C51、SAC、DDPG、TD3、PPG 與 RND。