MINT-SJTU/Evo-RL
We release Evo-RL, the opensource real-world offline RL on So-101 and AgileX PiPER for easier reproduction.
Evo‑RL – 現實世界強化學習工具包
簡介 – Evo‑RL 是一個開源框架,用於在現實世界的機器人平台上進行離線和線上強化學習。它建立在 LeRobot 函式庫(一個用於機器人數據收集和策略訓練的 Hugging Face 專案)之上,並增加了完整的流程,包括:
- 硬體整合 – 支援 Seeed Studio SO‑101 機械臂和 AgileX PiPER / PiPER‑X 機器人,並提供詳細的序列埠、CAN‑bus 和攝影機接線說明。
- 數據收集 – 提供命令列工具 (
lerobot‑human‑inloop‑record),讓人類可以遠端操作機器人,同時自動將多模態觀測數據(RGB、RealSense 深度、關節狀態)記錄到 Hugging Face 數據集中。 - 價值函數訓練與推論 – 在收集到的數據集上訓練一個 return‑to‑go 估計器(預設為 pistar06),並回寫價值、優勢和二元「優質軌跡」標籤。
- 策略訓練 – 使用標準的
lerobot‑train腳本,訓練一個以語言為條件的策略,將優勢條件標籤作為任務描述的一部分。 - 閉環部署 – 在人機協作迴圈中部署訓練好的策略,以收集下一輪數據,實現迭代改進。
該儲存庫附帶腳本、配置模板、無需 Docker 的 conda 安裝方式,以及 Hugging Face 上的公開 RW‑RL dataset。
快速入門摘要
# 克隆並設置環境
git clone https://github.com/MINT-SJTU/Evo-RL.git && cd Evo-RL
conda create -y -n evo-rl python=3.10
conda activate evo-rl
pip install -e . # 安裝套件與 CLI 入口點
之後您可以:
- 使用
lerobot-teleoperate驗證硬體(請參閱 README 以獲取單臂或雙臂設置的確切命令字串)。 - 使用
lerobot-human-inloop-record記錄數據集。 - 使用
lerobot-value-train訓練價值模型。 - 使用
lerobot-value-infer推論價值標籤。 - 使用
lerobot-train訓練策略。 - 使用相同的
lerobot-human-inloop-record命令並添加--policy.path=<checkpoint>來執行閉環部署。
README 中的關鍵功能
| 領域 | 儲存庫提供的功能 |
|---|---|
| 硬體支援 | 針對 SO‑101 (序列埠) 和 AgileX PiPER/PiPER‑X (USB‑CAN) 機器人的詳細配置,包括穩定的設備路徑建議和校準檔案佈局。 |
| 數據集處理 | 一鍵推送到 Hugging Face (--dataset.push_to_hub=true)、自動數據集報告 (lerobot-dataset-report) 以及公開的 RW‑RL 數據集。 |
| 價值函數 | 訓練腳本 (lerobot-value-train) 支援 bfloat16、透過 accelerate 進行多 GPU 啟動,以及用於自定義價值模型的插件架構。 |
| 優勢條件策略 (ACP) | 在價值推論後,數據集中會新增三欄 (value_<TAG>, advantage_<TAG>, acp_indicator_<TAG>);策略訓練腳本可以將二元指標作為文字標籤讀取,並支援 Dropout 控制。 |
| 端到端流程 | README 涵蓋了從安裝到下一輪數據收集的所有七個階段,讓使用者可以重現完整的研究迴圈。 |
| 社群與可重現性 | 提供專案網站、微信群組、即將發表的論文連結以及 Apache‑2.0 授權;所有程式碼、模型和數據集均旨在公開重複使用。 |
適用對象
- 機器人研究人員:需要一套現成的堆疊來在低成本機械臂上進行現實世界強化學習。
- ML 工程師:希望在機器人數據上嘗試優勢條件訓練。
- 教育工作者:希望進行從遠端操作數據收集到實際硬體策略部署的實作實驗室。
提及的限制
- 論文和預訓練模型標註為「即將推出」,因此目前儲存庫主要提供流程程式碼和 RW‑RL 數據集。
- 硬體特定步驟(例如校準、CAN‑bus 序列 ID)需要存取支援的機器人;儲存庫不提供模擬備援。
引用與授權
- 授權:Apache‑2.0 (根據
LICENSE徽章)。 - 引用:未來將發表論文;目前使用者可引用儲存庫 URL。
以上所有資訊均直接取自儲存庫的 README;未添加任何外部假設。
相關
- 專案
- 專案
- 專案
- 專案