MINT-SJTU/Evo-RL
We release Evo-RL, the opensource real-world offline RL on So-101 and AgileX PiPER for easier reproduction.
Evo‑RL – 実世界強化学習ツールキット
概要 – Evo‑RLは、実世界のロボットプラットフォーム上でオフラインおよびオンライン強化学習を行うためのオープンソースフレームワークです。LeRobotライブラリ(ロボットのデータ収集とポリシー学習のためのHugging Faceプロジェクト)を基盤としており、以下の完全なパイプラインを追加します。
- ハードウェア統合 – Seeed Studio SO‑101アームおよびAgileX PiPER / PiPER‑Xロボットをサポートし、シリアル、CAN‑bus、カメラの配線に関する詳細な手順を提供します。
- データ収集 – 人間がロボットを遠隔操作しながら、マルチモーダルな観測データ(RGB、RealSense深度、関節状態)をHugging Faceデータセットに自動的に記録できるコマンドラインツール (
lerobot‑human‑inloop‑record) を提供します。 - 価値関数の学習と推論 – 収集したデータセット上でreturn‑to‑go推定器(デフォルトは pistar06)を学習し、価値、アドバンテージ、およびバイナリの「良質な軌道」タグを書き戻します。
- ポリシー学習 – 標準の
lerobot‑trainスクリプトを使用して、アドバンテージ条件付きタグをタスク記述の一部として取り込む言語条件付きポリシーを学習します。 - クローズドループ展開 – 学習したポリシーをヒューマン・イン・ザ・ループで展開し、次のラウンドのデータを収集することで、反復的な改善を可能にします。
このリポジトリには、スクリプト、設定テンプレート、Docker不要のcondaインストール手順、およびHugging Face上の公開 RW‑RL dataset が含まれています。
クイックスタートの概要
# クローンと環境設定
git clone https://github.com/MINT-SJTU/Evo-RL.git && cd Evo-RL
conda create -y -n evo-rl python=3.10
conda activate evo-rl
pip install -e . # パッケージとCLIエントリーポイントのインストール
その後、以下の操作が可能です:
lerobot-teleoperateでハードウェアを検証(シングルアームまたは両腕セットアップの正確なコマンド文字列についてはREADMEを参照)。lerobot-human-inloop-recordでデータセットを記録。lerobot-value-trainで価値モデルを学習。lerobot-value-inferで価値タグを推論。lerobot-trainでポリシーを学習。- 同じ
lerobot-human-inloop-recordコマンドに--policy.path=<checkpoint>を追加して、クローズドループ展開を実行。
READMEに基づく主な機能
| エリア | リポジトリが提供するもの |
|---|---|
| ハードウェアサポート | SO‑101 (シリアル) および AgileX PiPER/PiPER‑X (USB‑CAN) ロボットの詳細な設定(安定したデバイスパスの推奨事項やキャリブレーションファイルのレイアウトを含む)。 |
| データセット処理 | Hugging Faceへのワンクリックプッシュ (--dataset.push_to_hub=true)、自動データセットレポート (lerobot-dataset-report)、および公開 RW‑RL データセット。 |
| 価値関数 | bfloat16をサポートする学習スクリプト (lerobot-value-train)、accelerate を介したマルチGPU起動、およびカスタム価値モデル用のプラグインアーキテクチャ。 |
| アドバンテージ条件付きポリシー (ACP) | 価値推論後、3つの新しい列 (value_<TAG>, advantage_<TAG>, acp_indicator_<TAG>) がデータセットに追加されます。ポリシー学習スクリプトは、バイナリインジケーターをテキストタグとして取り込み、ドロップアウト制御が可能です。 |
| エンドツーエンドパイプライン | READMEでは、インストールから次のデータ収集ラウンドまでの全7ステージを解説しており、研究ループ全体を再現可能です。 |
| コミュニティと再現性 | プロジェクトウェブサイト、WeChatグループ、近日公開予定の論文へのリンク、およびApache‑2.0ライセンス。すべてのコード、モデル、データセットはオープンに再利用可能です。 |
想定されるユーザー
- ロボット工学研究者:低コストのマニピュレーターで実世界強化学習を行うための準備済みスタックが必要な方。
- MLエンジニア:ロボットデータを用いたアドバンテージ条件付き学習を試したい方。
- 教育者:遠隔操作によるデータ収集から実際のハードウェアへのポリシー展開までを体験できるラボを構築したい方。
言及されている制限事項
- 論文と事前学習済みモデルは「近日公開」となっており、現在は主にパイプラインコードとRW‑RLデータセットが提供されています。
- ハードウェア固有の手順(キャリブレーション、CAN‑busシリアルIDなど)にはサポート対象のロボットへのアクセスが必要であり、シミュレーションの代替手段は提供されていません。
引用とライセンス
- ライセンス:Apache‑2.0 (
LICENSEバッジ参照)。 - 引用:論文は将来的に公開予定。現時点ではリポジトリのURLを引用してください。
上記の情報はすべてリポジトリのREADMEから直接引用したものであり、外部からの推測は含まれていません。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト