robbyant-research/Zero-WAM

In‑Context World‑Action Modeling from Human Videos for Open‑Ended Task Generalization

何を解決するか

Zero-WAMは、ゼロショットのクロストラックロボット操作の課題に対処します。ロボットが訓練されたことがないタスクを実行できるようにし、新しいロボット固有のトレーニングデータやパラメータ更新を必要とせずに、デプロイ時におけるコンテキスト(たとえば、人間のデモ動画や言語指示)を使用します。

仕組み

このプロジェクトでは、人間のデモ動画を視覚的なタスク仕様として扱います。因果的ビデオ-アクションポリシーを使用して、提供されたコンテキストに基づいて将来のロボットの観測と実行可能なアクションを予測します。これを訓練するために、研究者たちは「HumanGen」パイプラインを開発しました。このパイプラインはVLM、画像編集ツール、動画生成モデルを用いて、既存のロボット軌道を意味的に一致する人間の操作動画に変換し、大規模な人間-ロボットインコンテキスト学習(ICL)ペアのデータセットを構築しました。

対象ユーザー

この技術は、オープンエンドのタスク一般化とエンベデッドAIに取り組むロボット研究者やエンジニア向けに設計されており、特に新しい操作タスクごとに膨大なロボット収集データに依存することを減らしたいと考えている人にとって適しています。

主な特徴

  • インコンテキスト世界-アクションモデリング:言語と人間の動画の両方をタスク指示としてサポートする単一のポリシー。
  • HumanGenパイプライン:8.6Kのタスクにわたって74.2Kの人間-ロボットICLペアを生成するスケーラブルなシステム。
  • 将来のチャンク予測:ショートカット学習を低減し、モデルが人間の動画プロンプトに依存するよう促進する目的関数。
  • ゼロショットパフォーマンス:モデルパラメータの更新なしに、RoboTwin 2.0および実世界の未確認構成で成功を実証。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト