TeleHuman/PRTS
Official Implementation of "PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations"
何を解決するか
PRTS(Primitive Reasoning and Tasking System)は、行動クラウンティングに依存する標準的なビジョン・言語・アクション(VLA)モデルの限界に対処します。従来のモデルは「何をすべきか」を学習しますが、現在の状態が目標にどれほど近いかという内部理解を欠くことがよくあります。PRTSは、目標到達可能性の感覚をモデルに内面化する方法を導入し、単なる行動の学習にとどまらず、新しい指示に従い、介入からの回復もより効果的に行えるようにします。
仕組み
PRTSは、ビジョン・言語・アクション(VLA)モデルの事前学習フェーズに、報酬なしの対照的強化学習(RL)をスケーリングします。Qwen3-VLバックボーンを採用し、行動損失と並行して対照的価値ヘッドを共同学習させます。手動で作成された報酬ラベルや成功マーカーを必要とせず、オフラインのデモンストレーション軌道の時間的構造からのみ監視信号を抽出します。これにより、状態-行動と目標の埋め込みの内積が目標占有度を追跡する、言語に根ざした価値関数を学習できます。目標に近づくほどその値は上昇します。
対象ユーザー
ビジョン・言語・アクションモデルを扱うロボット工学の研究者および開発者で、新しい指示への一般化、長時間スパンのタスク実行、異なるロボットプラットフォーム(例:二腕型または単腕型システム)における実世界展開での堅牢性を必要とする方々。
主な特徴
- 報酬ラベル不要: エピソードごとの成功ラベルや手動で整備された報酬データセットを必要とせず、目標到達可能性を学習します。
- 目標到達可能性の認識: バックボーンに直接対照的価値ヘッドを統合し、モデルが目標への進行状況を理解できるようにします。
- 高い効率性: カスタムの CuTe-FlashAttention カーネルを使用し、事前学習の計算コストを従来の行動クラウンティングとほぼ同等に抑えます。
- 優れた一般化性能: シミュレーションおよび実世界環境において、新しい指示の遂行や分布外タスクにおいて、従来のVLAモデルを大きく上回る性能を発揮します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト