Lei-Kun/RL-100
[Science Robotics 2026] Official Implementation of the paper RL-100
解決的問題
RL-100 提供一個統一的框架,用於改善機器人操作策略。它透過提供可重複的後訓練策略強化學習(RL)流程,彌補初始模仿學習(行為克隆)與高性能量、可靠實際部署之間的差距。
工作原理
該系統實作一個多階段流程,從靜態資料逐步過渡到主動互動:
- 行為克隆:從人類示範資料初始化策略。
- 離線強化學習:使用記錄的軌跡透過策略梯度更新來優化策略。
- 線上強化學習:透過真實世界或模擬環境中的互動進一步微調策略。
- 一步蒸餾:將多步擴散或流模型策略轉換為高效的單步策略(如 Diffusion-to-CM),以實現快速真實機器人推論。
- 資料飛輪:一個迭代循環,將離線訓練的策略部署以收集新的機器人軌跡,然後將這些新資料合併回訓練資料集中,以進一步提升下一個離線強化學習回合的性能。
適用對象
專為從事視覺運動策略的機器人研究人員與工程師設計,為他們提供從遠端操作資料到穩健、可部署機器人控制的標準化路徑。
主要亮點
- 靈活的策略骨幹:支援擴散模型與流模型策略。
- 多模態觀測:相容 3D 點雲與 2D RGB 圖像。
- 多功能控制:支援動作分塊與高頻單動作控制。
- 整合資料工具:包含遠端操作資料收集與迭代式 Zarr 資料集管理的實用工具。
相關
- 專案
- 專案
- 專案
- 專案