InternRobotics/VLAC

VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning

解決する課題

VLACは、現実世界のロボット強化学習とデータ精製を改善するために設計されています。ロボット操作タスクにおいて、密で正確な報酬フィードバックを提供し、低品質の軌跡をフィルタリングするという課題を解決します。これは従来の手法では達成が困難な場合が多いです。

仕組み

VLACは、人間のエゴセントリック(一人称視点)データ、公開されているロボット操作データ、および自己収集したデータからなる大規模データセットで訓練されたビジョン・言語・アクション・クリティックモデルです。ペアワイズ比較メカニズムを使用してタスクの進行状況を評価し、フレーム間の状態変化を認識します。画像入力とタスク記述を組み合わせることで、モデルはタスクの進行状況を予測し、タスクの完了を確認し、成功したアクションと失敗したアクションを区別することができます。

対象者

このプロジェクトは、身体知能に取り組むロボット工学の研究者や開発者、特に強化学習、模倣学習、およびロボットの訓練用に高品質な軌跡データを必要とする人々を対象としています。

ハイライト

  • ペアワイズ比較:密なクリティック報酬と状態変化認識の精度を向上させます。
  • マルチモーダル機能:プロセス追跡、タスク完了判定、VQA、および身体アクション出力をサポートします。
  • ゼロショット/ワンショット汎化:追加の訓練なしで、新しいエンティティ、シナリオ、タスク全体でパフォーマンスを維持します。
  • 軌跡品質スクリーニング:低スコアの軌跡をフィルタリングし、ネガティブなアクションをマスクして、模倣学習の効率を向上させます。
  • 人間とタスクの共感覚:人間のエゴセントリックデータ (Ego4D) を活用し、現実世界の人間のタスクをより深く理解します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト