LucasAlegre/morl-baselines
Multi-Objective Reinforcement Learning algorithms implementations.
MORL‑Baselines – 多目的強化学習ライブラリ
何であるか – Pythonパッケージ(PyTorch)で、最先端の多目的強化学習(MORL)アルゴリズムの増加するコレクションを実装しています。MO‑Gymnasium環境APIに準拠しており、報酬がベクトル(目的ごとに1要素)として返されるGymnasiumのドロップインリプレースメントです。
なぜ重要か – MORLは、しばしば対立する複数の目標(例:速度 vs. 安全性、エネルギー消費 vs. 性能)をバランスさせる必要がある問題に取り組みます。研究者は新しいアイデアを比較するための信頼できる参照実装を必要とし、MORL‑Baselinesは選別され、テスト済み、ベンチマーク済みの実装セットを提供します。
コア機能(READMEに記載)
- スカラー化期待報酬(SER)および期待スカラー化報酬(ESR)基準をカバーするシングルポリシーおよびマルチポリシーアルゴリズム。
- MO‑Gymnasium準拠の厳密さ – どのMO‑Gymnasium環境もコード変更なしで交換可能。
- Weights & Biasesダッシュボードへの自動実験ログで再現可能なパフォーマンス追跡。
- 事前コミットフックでblackフォーマット、isortインポート、およびLintingを強制。
- パレート削減、リプレイバッファ、ニューラルネットヘルパーなどのユーティリティモジュールでボイラープレートを回避。
- オンザーデマンドのハイパーパラメータ最適化サポート。
- 完全なテストスイートと継続的インテグレーションバッジ。
実装済みアルゴリズム(スナップショット)
| アルゴリズム | ポリシー種別 | 基準 | 観測/行動空間 | 参照 |
|---|---|---|---|---|
| GPI‑LS / GPI‑PD | マルチ | SER | 連続観測、離散/連続行動 | [arXiv:2301.07784] |
| GPI‑LS (Jax) | マルチ | SER | 連続 | [Springerリンク] |
| MORL/D | マルチ | SER / ESR | 離散/連続 | [JAIR 2022] |
| Envelope Q‑Learning | マルチ | SER | 連続 | [arXiv:1908.08342] |
| CAPQL | マルチ | SER | 連続 | [OpenReview] |
| PGMORL | マルチ | SER | 連続 | [MIT論文] |
| パレート条件付きネットワーク(PCN) | マルチ | SER/ESR* | 連続 | [AAMAS 2022] |
| ロレンツ条件付きネットワーク(LCN) | マルチ | SER/ESR* | 連続 | [JAIR] |
| パレートQ‑Learning | マルチ | SER | 離散 | [JMLR 2015] |
| MO Q‑Learning | シングル | SER | 離散 | [ResearchGate] |
| MPMOQL(外ループMOQL) | マルチ | SER | 離散 | [ResearchGate] |
| 極めて楽観的な線形サポート(OLS) | マルチ | SER | – | 博士論文章 |
| 期待効用ポリシー勾配(EUPG) | シングル | ESR | 離散 | [ResearchGate] |
| 繰り返しパレート参照最適化(IPRO / IPRO‑2D) | マルチ | SER | 連続 | [arXiv:2402.07182] |
| 非線形多目的PPO(NLMOPPO) | シングル | SER | 連続 | [VUB論文] から導出 |
*PCNは確定的遷移を仮定;IPRO‑2Dは正確に2つの目的にのみ対応。
ベンチマークと再現性
- Open RL Benchmarkスイートと統合されており、CleanRL、Stable‑Baselines3などと並列比較が可能。
- 実験結果はWeights & Biasesプロジェクトで公開: https://wandb.ai/openrlbenchmark/MORL-Baselines。
- 詳細なプロトコルと設定はリポジトリのイシュー追跡(#43)およびプロジェクトウェブサイトに記載。
クイックスタート(導入)
# クローンとインストール(Python ≥3.9必須)
git clone https://github.com/LucasAlegre/morl-baselines.git
cd morl-baselines
pip install -e . # パッケージと依存関係をインストール
例を実行(例:連続制御MO‑Gymnasium環境でのGPI‑LS):
python -m examples.run_gpi_ls --env mo_gymnasium:HalfCheetah-v0 --weights-and-biases
READMEにインタラクティブデモ用のColabノートブックがリンクされています。
コミュニティと貢献
- 議論用のDiscord: https://discord.gg/ygmkfnBvKA
- プルリクエストを歓迎 – 新アルゴリズム、バグ修正、ドキュメント改善を歓迎します。
- メンテナ:Florian Felten(ffelten)とLucas N. Alegre(LucasAlegre)。
ライセンスと引用
- MITライセンス(許容性高く、商業利用に適しています)。
- 研究でこのライブラリを使用する場合、NeurIPS‑2023論文を引用してください:
@inproceedings{felten_toolkit_2023,
author = {Felten, Florian and Alegre, Lucas N. and Nowé, Ann and Bazzan, Ana L. C. and Talbi, El Ghazali and Danoy, Grégoire and Silva, Bruno Castro da},
title = {A Toolkit for Reliable Benchmarking and Research in Multi-Objective Reinforcement Learning},
booktitle = {NeurIPS 2023},
year = {2023}
}
TL;DR
MORL‑Baselinesは、テスト済みでメンテナンスが行き届いたPyTorchライブラリであり、数十の多目的RLアルゴリズムの実行可能実装を研究者に提供し、すべてMO‑Gymnasium APIと再現可能なベンチマークツールに統合されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト