PKU-EPIC/GraspVLA

[CoRL25] GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

何を解決するか

GraspVLAは、ロボットの把持モデルを訓練する際の高コストとデータ不足の問題に対処します。実世界のオブジェクトを多様に扱うオープンボリュームの把持を、高価な実世界のファインチューニングなしで実現し、シミュレーションから実世界への直接的な転送を達成します。

仕組み

このプロジェクトは3つの主要な構成要素で構成されています:

  1. SynGrasp-1B:240種類のオブジェクトカテゴリと10,000個以上のオブジェクトをカバーする、10億フレームに及ぶ巨大な合成データセット。
  2. GraspVLAモデル:合成データ上で事前学習されたビジョン・言語・アクション(VLA)モデル。自己回帰的認識(バウンディングボックスと目標の予測)とフローマッチングベースのアクション生成を統合する、統一された思考過程(CoT)フレームワークを使用しています。
  3. ハイブリッド学習:合成アクションデータとインターネット規模の意味データの両方でモデルを学習させ、オープンボリュームの命令を理解し、実行できるようにしています。

対象ユーザー

ロボット操作、シミュレーションから実世界への転送、そして身体的な知能のための基礎モデルに取り組むロボティクス研究者および開発者。

主な特徴

  • ゼロショット一般化:合成データでの事前学習後、追加のファインチューニングなしで実世界のオブジェクトを把持可能。
  • 10億規模のデータ:SynGrasp-1Bデータセットを活用し、多様なトレーニング例を提供。
  • 効率的な推論:NVIDIA RTX L40sで約9GBのGPUメモリを使用し、200msの推論遅延を達成。
  • 統合された推論:CoTフレームワークにより、認識とアクションを1つの推論プロセスに統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト