Lei-Kun/RL-100

[Science Robotics 2026] Official Implementation of the paper RL-100

解決的問題

RL-100 提供一個統一的框架,用於改善機器人操作策略。它透過提供可重複的後訓練策略強化學習(RL)流程,彌補初始模仿學習(行為克隆)與高性能量、可靠實際部署之間的差距。

工作原理

該系統實作一個多階段流程,從靜態資料逐步過渡到主動互動:

  1. 行為克隆:從人類示範資料初始化策略。
  2. 離線強化學習:使用記錄的軌跡透過策略梯度更新來優化策略。
  3. 線上強化學習:透過真實世界或模擬環境中的互動進一步微調策略。
  4. 一步蒸餾:將多步擴散或流模型策略轉換為高效的單步策略(如 Diffusion-to-CM),以實現快速真實機器人推論。
  5. 資料飛輪:一個迭代循環,將離線訓練的策略部署以收集新的機器人軌跡,然後將這些新資料合併回訓練資料集中,以進一步提升下一個離線強化學習回合的性能。

適用對象

專為從事視覺運動策略的機器人研究人員與工程師設計,為他們提供從遠端操作資料到穩健、可部署機器人控制的標準化路徑。

主要亮點

  • 靈活的策略骨幹:支援擴散模型與流模型策略。
  • 多模態觀測:相容 3D 點雲與 2D RGB 圖像。
  • 多功能控制:支援動作分塊與高頻單動作控制。
  • 整合資料工具:包含遠端操作資料收集與迭代式 Zarr 資料集管理的實用工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案