Lei-Kun/RL-100

[Science Robotics 2026] Official Implementation of the paper RL-100

何を解決するか

RL-100 はロボット操作ポリシーの改善を可能にする統合フレームワークを提供します。初期の模倣学習(行動クラッシング)と高性能で信頼性の高い現実世界での展開の間のギャップを埋めるために、強化学習(RL)を用いたポリシーの後処理の繰り返し可能なパイプラインを提供します。

動作方法

このシステムは、静的データからアクティブな相互作用へと移行するマルチステージパイプラインを実装しています:

  1. 行動クラッシング:人間のデモンストレーションからポリシーを初期化します。
  2. オフラインRL:ログされた軌道を用いてポリシーをポリシー勾配更新で改善します。
  3. オンラインRL:現実世界またはシミュレーションでの相互作用を通じてポリシーをさらに微調整します。
  4. ワンステップ蒸留:複数ステップの拡散またはフロー型ポリシーを効率的なワンステップポリシー(例:Diffusion-to-CM)に変換し、リアルロボットでの高速推論を実現します。
  5. データフライホイール:オフラインで訓練されたポリシーをデプロイして新しいロボットのロールアウトを収集し、それをトレーニングデータセットに統合することで、次のオフラインRLラウンドをさらに改善する反復ループです。

対象ユーザー

視覚運動ポリシーの開発に取り組むロボット研究者およびエンジニア向けに設計されており、遠隔操作データから堅牢でデプロイ可能なロボット制御へと移行するための標準化された方法を必要とする方々に適しています。

特徴

  • 柔軟なポリシーのバックボーン:拡散型とフロー型ポリシーの両方をサポートします。
  • マルチモーダル観測:3Dポイントクラウドと2D RGB画像の両方に対応します。
  • 多様な制御:アクションチャンクと高周波の単一アクション制御の両方をサポートします。
  • 統合されたデータツール:遠隔操作データ収集と反復的なZarrデータセット管理のユーティリティを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト